Yapay Zekâ Günlüğü — 8 Eylül 2026
Bugün de büyük bir model çıkışı yok — ama dün bildirdiğimiz bir sayının aslında göründüğü gibi olmadığı ortaya çıktı. Bağımsız bir sıralama sistemi kendi ölçütünü değiştirdi ve bu, "sıralamada zirveye yaklaştı" gibi haberlerin ne kadar dikkatli okunması gerektiğini hatırlattı. Bunun yanında küçük ama telefonda bile çalışabilecek yeni bir açık kaynak model geldi.
Günün başlığı
Bağımsız sıralama sistemi sürüm değiştirdi, dünkü "sıçrama" aslında bir yeniden ölçümmüş. Artificial Analysis, yapay zekâ modellerini karşılaştıran bağımsız bir kuruluş; genel zekâ endeksini dün v4.2'den v4.3'e geçirdi. Bu geçişle bütün modellerin puanları yeniden hesaplandı ve zirvedeki modeller ortalama 4 puan birden düştü. Bugünkü tabloda dört model başı başa: Claude Fable 5.1 ve GPT-6 Astra, ikisi de en yüksek "düşünme düzeyinde" (bir modelin cevap vermeden önce ne kadar uzun akıl yürüteceğini belirleyen ayar) 53 puanla eşit çıktı.
Bunun önemi şurada: dün bir modelin "hafif" ayarının zirveye tek günde yaklaştığı yazılmıştı. Bugün anlaşıldı ki bu, modelin gerçekten iyileşmesinden değil, ölçüm yönteminin değişmesinden kaynaklanıyormuş. Sıralama tabloları gün gün karşılaştırıldığında böyle yanıltıcı sıçramalar görülebiliyor — asıl bakılması gereken, ölçüm sürümü aynı kaldığı sürece elde edilen fark. Endeksin bileşimi de dikkat çekici: yarısı yapay zekânın kendi başına iş yapma ve kod yazma becerisini ölçüyor, geri kalanı genel bilgi ve bilimsel akıl yürütmeyi. Kaynak: AA sıralama, AA metodoloji.
Kısa kısa
- Yeni bir küçük açık kaynak model: MiniCPM5-2B. 2,5 milyar parametreli bu model, kendi tanıtım sayfasına göre kendi büyüklük sınıfında en iyi performansı veriyor ve Apache-2.0 lisansıyla serbestçe kullanılabiliyor. Boyutu küçük olduğu için bilgisayarda, hatta güçlü telefonlarda çalışabilecek şekilde hazırlanmış. Şu an yalnızca İngilizce ve Çince için eğitilmiş. Model kartı
- Ollama'nın yeni sürümü hâlâ test aşamasında. Yerel bilgisayarda model çalıştırmaya yarayan açık kaynak araç Ollama'nın v0.34.0 sürümü üçüncü gündür "aday sürüm" etiketiyle bekliyor, kararlı sürüm henüz yayımlanmadı. Ollama sürüm notları
- İnsan tercihine dayalı sıralama yedinci gündür donuk. arena.ai listesi hâlâ 2 Eylül'deki hâliyle duruyor; ilk 15 modelin sekizi Anthropic'e ait, GPT-6 Astra hâlâ listede yok. arena.ai
- "Grok 4.7" söylentisi hâlâ doğrulanmadı. xAI'nin kendi sisteminde en yeni sohbet modeli hâlâ 6 Ağustos tarihli grok-4.6; yeni bir sürümün 12 Eylül'de geleceğine dair konuşulanlar şimdilik bir iddia. xAI kılavuzu
Rakamlar
Anthropic'in resmî fiyat sayfasında bugün bir değişiklik yok. Ama yarın bir fiyat değişikliği yürürlüğe giriyor: Z.AI'nin GLM-5.3-Flash modelindeki tanıtım indirimi 9 Eylül akşamı sona eriyor, fiyat ikiye katlanacak (milyon token başına girdi fiyatı $0,075'ten $0,15'e). Z.AI fiyatlandırma
Ne anlama geliyor
Bugünün dersi bir haberden çok bir okuma alışkanlığı: bir sıralamada "zirveye yaklaştı" ya da "sıçrama yaptı" yazan her haber, ölçüm yönteminin aynı kaldığından emin olunca anlam kazanıyor. Küçük açık kaynak modellerin sayısı artmaya devam ediyor, bu da yapay zekânın gitgide daha fazla cihazda, daha ucuza çalışabileceği anlamına geliyor — dil kapsamı gibi sınırlar hâlâ var olsa da. İkisi de aynı şeyi söylüyor: alan hızla ilerliyor, ama ilerlemeyi doğru ölçmek kendi başına bir emek istiyor.
Yapay Zekâ Günlüğü her gün yayımlanır. Üreticinin kendi iddiası ile bağımsız ölçüm ayrı yazılır; doğrulayamadığımız her şey "doğrulanamadı" damgasıyla verilir.