RADAR ·
Anthropic, model geliştirme işinin yüzde 26'sını Claude'un yürüttüğünü açıkladı
Anthropic ilk kez kendi model geliştirme sürecine dair ölçümler yayımladı. Epoch AI'ın AL0-AL5 ölçeğine göre ağustos 2026'da işin yüzde 26'sı, yapay zekanın yürüttüğü kabul edilen AL4 seviyesinde; bu oran şubatta yüzde birin altındaydı. İşin yüzde 90'dan fazlası en az AL3'te, tam özerk sayılan AL5'te ise hiçbir iş yok. Şirketin verdiği AL4 örneğinde Claude bir hata kaydını analiz ediyor, düzeltiyor ve test ediyor, ama yayına alma kararı insanda kalıyor. Puanlamayı Claude'un kendisi yaptı; Anthropic bu yargıcın denetlediği sistemle aynı hataları yapabileceğini kabul ediyor. Aynı alanı değerlendiren iki çalışan yalnızca üçte bir oranında aynı seviyede buluştu. Rapora göre iç platformda aynı anda yaklaşık 30 bin ajan çalışıyor; ağustosta verilen bir milyardan fazla kararın yüzde 0,002'si engellendi.
Kaynak: The Decoder