RADAR ·
Meta, saatlik 0,18 dolara gerçek zamanlı bir transkripsiyon modeli yayımladı

Meta'nın Superintelligence Labs birimi, sesi 80 milisaniyelik parçalar halinde işleyen ve her kelime için metne dökmeden önce ne kadar dinleyeceğine kendisi karar veren canlı transkripsiyon modeli Muse Voice Transcribe'ı yayımladı. Aynı model 20'den fazla konuşmacıyı ayırıyor ve cümle sınırlarını işaretliyor. 70'ten fazla dili destekliyor; 25'i ayrıntılı test edilmiş.
Artificial Analysis'in bağımsız değerlendirmesinde model İngilizcede yüzde 3,1 kelime hata oranına ve konuşmacı sustuktan 0,16 saniye sonra sonuca ulaştı; doğrulukta ElevenLabs, AssemblyAI ve Cartesia'nın önünde. Fiyat, saatlik ses için 0,18 dolar; rakip servislerin altında. Meta modeli, kameralı gözlükleri üzerinden konuşmaları dinleyen asistanlar için bir yapı taşı olarak sunuyor. Ağırlıklar yayımlanmıyor.
Kaynak: The Decoder