RADAR ·
Kod ajanları fotoğraftan 3B sahne kuruyor ama sonucu doğru değerlendiremiyor

Maryland Üniversitesi ve AWS araştırmacılarının geliştirdiği LEGO-Anything, tek bir fotoğraftan Blender için çalıştırılabilir kod yazarak düzenlenebilir bir 3B sahne kuruyor. Sistemdeki kod ajanı sahneyi tek seferde üretmiyor; kodu yazıyor, çalıştırıyor, sonuca bakıp düzeltiyor. Ekip yöntemi ölçmek için 104 sahneden 208 görsel içeren LEGO-Bench testini hazırladı. Denenen altı GPT yapılandırmasının hepsi neredeyse her seferinde çalışan bir sahne teslim etti, ancak doğruluk büyük farklar gösterdi. En iyi sonucu alan GPT-6 Astra iç mekânlarda yüzde 53,4, dış mekânlarda yüzde 39,6 doğruluğa ulaştı; zayıf yapılandırmalar yüzde 15 civarında kaldı.
En belirgin zayıflık öz değerlendirmede görüldü. İki sürümden hangisinin asıl görüntüye daha yakın olduğunu seçerken modellerin geometri yargısı yazı tura düzeyinde ya da altında kaldı. Araştırmacılar, modelin kendi yargısı yerine somut ölçümlere dayanan LEGO-Plugin eklentisini geliştirdi. Eklenti altı modelin hepsini iyileştirdi; en büyük kazanç zayıf modellerde görüldü.
Kaynak: The Decoder