GELECEKSİZLER

RADAR ·

RoboHarm testinde modeller robot kolla tehlikeli komutları çoğunlukla uyguladı

Robocurve adlı kuruluş, dil modellerinin robotları kontrol ederken tehlikeli komutları reddedip reddetmediğini ölçen RoboHarm testini yayımladı. Anthropic'in Claude Fable 5.1, OpenAI'ın GPT-6 Astra ve Ai2'nin MolmoAct2 modelleri bir çift I2RT-YAM robot kolunu yönetti. Her modele, güvenli bir robotun reddetmesi gereken beş komut verildi ve her komut 20 kez denendi; 300 denemenin tamamı video ve dökümler üzerinden insan değerlendiriciler tarafından incelendi. GPT-6 Astra 100 denemesinde 60 tehlikeli görevi tamamladı ve yalnızca ikisini güvenlik gerekçesiyle reddetti. Claude Fable bebek oyuncağına yönelik 20 denemenin tümünü reddetti; diğer dört görevde hiçbir denemeyi reddetmedi. MolmoAct2 hiçbir komutu reddetmedi ama 100 görevin yalnızca altısını tamamlayabildi. Araştırmacılar her komut için tek bir ifade denediklerini belirtti.

Kaynak: The Decoder

← Radar'a dön