Teknoloji

Google, Gemini 3.5 Transcribe ile sesi 85 dilde otomatik düzeltiyor

Adrian Kessler

Gemini 3.5 Transcribe yalnızca söyleneni yakalamaz. Konuşmacının söylediklerini aslında söylemek istediklerine dönüştürür. Bir konuşmacı cümle ortasında kendini düzelttiğinde — ‘Toplantıyı Salı’ya, hayır Çarşamba’ya alalım’ — model ‘Çarşamba’ çıktısını verir ve düzeltmeyi atar. Dolgu sözcükler kaybolur. Arka plan gürültüsü onu durdurmaz. Sonuç, ham ses kaydı değil, cilalanmış, biçimlendirilmiş metin olarak gelir.

Röportaj, podcast veya çok dilli içerik kaydeden herkes için bu ayrım, tüm iş akışıdır. Piyasadaki her transkripsiyon aracı ‘söyleneni’ işler. Ardından gelen insan editör geri kalan her şeyi halleder. Google şimdi bu editörü modelin kendisine inşa ediyor.

Model iki farklı API yolu sunuyor. Live API, sürekli çift yönlü akışı saniyenin altında gecikmeyle işler — gerçek zamanlı sesli ajanlar, müşteri hizmetleri botları ve anlık transkripsiyon gerektiren her şey için tasarlanmıştır. Interactions API ise kaydedilmiş sesi işler: tam toplantılar, çağrı kayıtları ve röportajlar; üç katılımcıya kadar konuşmacı ataması ve zaman damgaları sunar. Her ikisi de akış modunda %4,0, akışsız modda %2,6 kelime hata oranına ulaşır — bağımsız kıyaslama firması Artificial Analysis tarafından ölçülmüştür. Google’ın önceki konuşmadan metne modeli Chirp 3, nihai transkripsiyona ulaşmak için %70 daha fazla zaman gerektiriyordu.

Tüketici tarafındaki lansman daha mütevazı. Android’de Gboard Rambler, sesten metne giriş için halihazırda Gemini 3.5 Transcribe’ı kullanıyor. Gemini macOS uygulaması, Speak to Window özelliği aracılığıyla İngilizce olarak destekliyor. Chrome’un yakında geleceği belirtiliyor; bu, kullanıcıların uygulama değiştirmeden herhangi bir web alanına — yanıtlar, gönderiler, formlar — dikte etmesine olanak tanıyacak. Bu kullanıma sunum için belirli bir tarih onaylanmadı.

Modelin sınırlamaları önemli. Çok konuşmacılı atama üç katılımcıyla sınırlı; daha büyük kadrolu paneller ve yuvarlak masa toplantıları geçici çözümler gerektiriyor. Tüketici Rambler uygulaması şu anda ‘seçili ülkeler ve dillerde’ mevcut, modelin desteklediği 85 dilin tamamında değil. Google, API için herhangi bir fiyatlandırma duyurmadı; API, Google AI Studio üzerinden herkese açık ön izlemede. Kurumsal erişim, fiyatlandırmanın ayrı ayrı müzakere edildiği Gemini Enterprise Agent Platform üzerinden sağlanıyor. Küçük içerik üreticileri için maliyet sorusu hâlâ açık.

Rekabet çerçevesi de önemli. OpenAI‘in Whisper’ı, hâlâ bağımsız geliştiriciler için varsayılan seçenek, İngilizce ses üzerinde %5-7 aralığında kelime hata oranlarına ulaşıyor ve dolgu kaldırma ile biçimlendirme için işlem sonrası kod gerektiriyor. AssemblyAI ve Deepgram gibi hizmetler konuşmacı ayırma sunuyor ancak Gemini 3.5 Transcribe’ın varsayılan olarak uyguladığı yerleşik doğal dil düzeltmesini sunmuyor. Fark ölçülebilir, ancak 85 dil aralığının zorlu ucunda — bölgesel aksanlar, düşük kaynaklı diller, gürültülü ortamlar — nasıl dayandığını belirlemek için bağımsız testler gerekecek.

Google’ın uzun vadeli yönü hakkında en çok sinyal veren özellik Chrome entegrasyonu. Sesli giriş herhangi bir web alanında çalıştığında, model artık bir geliştirici aracı değil — insanların nasıl yazdığına dair bir altyapı haline gelir. Bu değişikliğin kullanıma sunulma zaman çizelgesi onaylanmadı.

Etiketler: , , , , ,

Tartışma

S kadar yorum var.