RADAR ·
Anthropic'e göre Çinli GLM-5.3 modeli ileri siber saldırı eşiğini geçti
Anthropic'in Frontier Red Team ekibi, “GLM-5.3 ve ileri siber yeteneklerin yayılması” başlıklı bir değerlendirme yayımladı. Ekip, şirket içi ikili dosya istismarı testinden rastgele seçilen 100 görevde birkaç modeli sınadı. Çin'de geliştirilen GLM-5.3, denemelerin yüzde 4'ünde programın kontrol akışını tamamen ele geçirmeyi başardı; Anthropic'in Claude Mythos Preview modelinde bu oran yüzde 6 oldu. Ölçülen beceri, bir yazılım açığını kullanarak programın çalışma sırasını saldırganın istediği yöne çevirmek anlamına geliyor.
Claude Opus 4.6 ve GLM-5.2 gibi önceki modeller görevlerin hiçbirinde başarılı olamadı. Ekip, GLM-5.3'ün Mythos Preview'ın gerisinde kalmasına rağmen anlamlı bir eşiğin açıkça aşıldığını yazdı.
“a meaningful threshold has clearly been crossed”Anthropic Frontier Red Team
Kaynak: Simon Willison