Yapay Zekâ Günlüğü — 26 Eylül 2026
Yapay zekâ modellerini karşılaştıran en büyük bağımsız sıralama, on iki günlük sessizliğin ardından dün güncellendi ve zirvede yeni bir isim çıktı. Aynı gün Anthropic, kendi güvenlik filtrelerinin durdurduğu bazı istekler için artık ücret alacağını duyurdu. İkisi birlikte okununca ortaya çıkan tablo şu: alan hem hızlanıyor hem kendi kurallarını yeniden yazıyor.
Günün başlığı
Bağımsız sıralamada yeni bir birinci var: Anthropic'in Opus 5.5 modeli, ama fark küçük.
Arena (kullanıcıların iki modelin cevabını yan yana görüp oy verdiği, bağımsız bir karşılaştırma sitesi) metin sıralaması 25 Eylül'de güncellendi. Zirvede `claude-opus-5.5` 1509 puanla, 2.307 oyla yer alıyor. Hemen arkasında Opus 4.6, Fable 5 ve Opus 4.7 var; hepsi 1500 puan civarında.
Burada dikkat edilmesi gereken bir ayrıntı var: ölçümün güven aralığı (confidence interval — ölçümün ne kadar kesin olduğunu gösteren, yukarı ve aşağı sapma payı) ±12 puan. Bu da ilk dört modelin istatistiksel olarak birbirinden ayırt edilemediği anlamına geliyor. Yani "yeni model açık ara birinci" demek yanlış olur; daha doğrusu, yeni model artık aynı ligde. Model yeni girdiği için oy sayısı da henüz az; sıra önümüzdeki günlerde değişebilir. Arena
Kısa kısa
- Anthropic, güvenlik filtresine takılan bazı istekleri ücretlendirmeye başlıyor. Claude bir soruyu cevaplamadan önce durduran güvenlik sınıflandırıcısı (classifier — riskli içeriği daha yanıt üretilmeden yakalayan otomatik denetim) artık üç dar kategoride — biyoloji, model damıtma saldırıları, öncü yapay zekâ geliştirme — normal bir istek gibi ücrete tabi. Şirket gerekçe olarak son haftalardaki koordineli kötüye kullanım girişimlerini gösteriyor; hesapların yüzde 99,7'si bu engellere hiç takılmamış. Not: duyurunun kendi orijinal metnine ulaşılamadı, haber ikincil kaynaklardan doğrulandı. özet
- Claude Code'a bir "eski istem" tarayıcısı eklendi. Kod yazma asistanının yeni sürümü, projelerdeki talimat dosyalarını artık "eski modeller için yazılmış, güncelliğini yitirmiş kalıplar" açısından tarayabiliyor. Ayrıca gözetimsiz çalıştırmalar artık arayüz yüklemeden başlıyor, bu da otomasyon hatlarını hızlandırıyor; model yedeğe düşerken ortaya çıkan bir hata da giderildi. changelog
- Google DeepMind, Gemini 4'ün erken post-training (post-training — bir modelin temel eğitiminden sonraki ince ayar aşaması) sürecinde olduğunu doğruladı. Şirket "yıl sonundan çok daha önce" çıkacağını söylüyor ama tarih vermedi. 9to5Google
- Açık kaynak tarafında sessiz bir ilerleme: llama.cpp'nin PrismML dalına (açık kaynaklı model çalıştırma motorunun bir türevi) sekiz yeni commit girdi; Apple bilgisayarlarda çalışan modeller için küçük bir hız iyileştirmesi de bunlardan biri. Modelin kendisi henüz bağımsız olarak doğrulanmadı. sürüm notu
Rakamlar
Arena'da zirve: `claude-opus-5.5` 1509 (±12) · `claude-opus-4.6` 1505 (±3) · `claude-fable-5` 1504 (±4) · `claude-opus-4.7` 1502 (±4). Anthropic dışından ilk sırada `muse-spark-1.2` var. Fiyat tarafında bugün doğrulanmış bir değişiklik yok.
Ne anlama geliyor
Dünün iki haberi aslında aynı olgunlaşma sürecinin iki yüzü. Bir yanda bağımsız ölçüm, aylardır konuşulan bir modelin gerçekten iyi olduğunu teyit ediyor — ama teyit "açık ara birinci" değil, "artık aynı ligde" diyor, ve bu ayrımı okumak önemli. Öte yanda bir şirket, kendi güvenlik önlemlerinin de bir maliyeti olduğunu kabul ediyor ve bunu kullanıcıya yansıtıyor. İkisi de heyecanlı bir "çığır açıldı" haberi değil; ikisi de alanın kurallarının hâlâ yazılmakta olduğunu gösteriyor.
--- Kaynaklar: Arena — metin sıralaması · Anthropic ücretlendirme değişikliği (özet) · Claude Code changelog · Gemini 4 — 9to5Google · PrismML llama.cpp sürüm notu
Bu bülten günlük olarak yayımlanır. Sorular ve düzeltmeler için: timeofagi.com