RADAR ·
DeepMind'ın Dream-RSI yöntemi eski aramaları yeniden oynatarak hesap yükünü azaltıyor
Google ve DeepMind araştırmacıları, kendini geliştiren ajanların arama stratejisini ucuzlatan Dream-RSI yöntemini tanıttı. Ajan, tamamlanmış bir aramadaki denemeleri ve sonuçlarını kaydediyor; yeni stratejileri canlı çalıştırmak yerine bu kayıt üzerinde sınıyor. Böylece modeli veya değerlendiriciyi yeniden çağırmadan binlerce alternatif deneniyor. Yöntem modeli değiştirmiyor, yalnızca aramanın nasıl yürütüldüğünü değiştiriyor. Gemini 3.1 Pro ve Gemini 3.7 Flash ile üç alanda sekiz görevde test edildi. İstatistiksel bir hesaplama için yazılan programda Gemini 3.1 Pro ile ortalama çalışma süresi 3.587 milisaniyeden 2.931 milisaniyeye, deneme sayısı 550'den 317'ye indi; rakip sistem SimpleTES aynı iş için 51.200 koşu kullandı. İki GPU çekirdeği görevinde aynı başarım 2,43 kata kadar az koşuyla elde edildi. Kod GitHub'da yayımlandı.
Kaynak: The Decoder