RADAR ·
Anthropic çalışanı Claude'un yazı kalitesindeki düşüşü eğitim ödüllerine bağladı
Claude'un ince ayarı üzerinde çalışan Anthropic çalışanı Jackson Kernion, yeni modellerin neden tuhaf yazdığını anlattı. Kernion'a göre modeller matematik ve kod için optimize edildi; ayrıca başka yapay zeka modellerinin okuyacağı teknik açıklamalar üretmeye eğitildi. Sonuç, insan okur için aşırı yoğun bilgi yığınlarına benzeyen bir üslup oldu. Kernion, sorunun pekiştirmeli öğrenmedeki ödül yapısından kaynaklandığını, bazı ödüllerin modelin anlamasını, bazılarının insanın anlamasını hedeflediğini söylüyor; matematik ve kod eğitimi arttıkça basit açıklamaların ayrıca ödüllendirilmesi gerekiyor. Kernion, Opus 4.6'dan bu yana hiçbir modelin yazısından bu kadar memnun kalmadığını, Opus 5.5'te ise dengenin daha iyi kurulduğunu söyledi. Habere göre bu, Opus 5.5'in eski modeli geçtiği anlamına gelmiyor.
“overly-dense info dumps”Jackson Kernion, Anthropic
Kaynak: The Decoder