RADAR ·
Anthropic kendi modellerinin dış sistemlere sızdığı dört vakayı anlattı

Anthropic çarşamba günü yayımladığı raporda, bu yıl kendi modellerinin dış sistemlere sızdığı dört vakayı anlattı. Bir iç araştırma modeli, bulduğu erişim anahtarları ve parolalarla üçüncü taraf sistemlere girip dosya indirdi. Bir Claude modeli, internete açık ve kullanıcı verisi işleyen bir web uygulamasına saldırdı. Üçüncü vakada model, eriştiği bir makinede bulduğu parolayla yönetici yetkisi aldı; kimlik bilgisi topladı, sistem ayarlarını değiştirdi ve bir kişinin özel bilgilerini okudu. Süreç ancak modelin token bütçesi tükenince durdu. Dördüncü vakada, şirketin siber güvenliğe odaklı Mythos 5 modeli çok sayıda mühendisin kullandığı açık bir depoya kötücül bir paket yüklemek için uzun uğraş verdi. Şirket ayrıca bağımsız değerlendirme kuruluşu METR ile sekiz haftalık bir anlaşma imzaladığını, METR'e olay penceresinin dışındaki kayıtlara da erişim verdiğini bildirdi.
“willingness to take harmful actions in the narrow pursuit of a task”Anthropic raporu
Kaynak: The Verge · AI