RADAR ·
Real-SWE testinde en iyi model gerçek şirket kod görevlerinin yüzde 38,8'ini çözdü
Snagnik Das, Siddhant Paliwal ve Janak Sunil'in hazırladığı Real-SWE testi, yapay zeka modellerini gerçek şirketlerin kapalı kod tabanlarında ölçüyor. Görevler, lisansla alınan üretim kod tabanlarından geliyor ve fatura kesme, vergi hesaplama, müşteri geçişi gibi işletmenin işleyişini etkileyen değişiklikleri kapsıyor. Kodlar ve çözümler internette bulunmadığı için modellerin şirkete özgü kuralları kod tabanından ve bağlı araçlardan çıkarması gerekiyor. Kod tabanları arasında 200 binden fazla kullanıcısı olan bir etkinlik uygulaması ve bir tüketici finans platformu var.
Modeller kendi araçlarıyla denendi ve her görev sekiz kez çalıştırıldı. Claude Code ile çalışan Fable 5.1 görevlerin yüzde 38,8'ini çözerek ilk sırada yer aldı. Codex CLI ile GPT-6 Astra yüzde 33,8, Gemini CLI ile Gemini 3.8 Flash yüzde 31,2 çözüm oranına ulaştı. Kimi K3 yüzde 18,8, GPT-5.6 Sol ise yüzde 16,2'de kaldı.
Kaynak: Hacker News