Google, Gemini 3.5 Transcribe ile konuşmayı yazıya dönüştürmede çığır açıyor

Google, Gemini 3.5 Transcribe'ı tanıttı; bu yeni model, karmaşık sesleri bile doğru ve düzenli metne çeviriyor.

WBH Editör30 Ağustos 2026 ~1 dk okuma

Google, sesli etkileşimleri daha da akıllı hale getirmek amacıyla tasarladığı en yeni konuşmayı metne dönüştürme modeli Gemini 3.5 Transcribe'ı duyurdu. Bu yeni model, geleneksel konuşma tanıma sistemlerinin zorlandığı arka plan gürültüsü, teknik terimler ve konuşma kusurları gibi sorunların üstesinden gelmeyi hedefliyor. Gemini 3.5 Transcribe, ham sesi doğrudan doğru, düzenlenmiş ve biçimlendirilmiş metne dönüştürme yeteneğiyle öne çıkıyor.

Şirket, bu transkripsiyon modelinin halihazırda Gemini uygulaması ve Android gibi ürünlerinde, Rambler gibi yeni sesli özelliklerle kullanıcılara fayda sağladığını belirtiyor. Artık geliştiriciler de Gemini API aracılığıyla Google AI Studio ve Gemini Enterprise Agent Platform'da benzer yetenekleri kendi uygulamalarına entegre edebilecekler. Bu, sesli asistanlar, gerçek zamanlı altyazı araçları veya çağrı sonrası analiz sistemleri oluşturmak isteyen geliştiriciler için önemli bir adım.

Gemini 3.5 Transcribe, doğal konuşma tarzını yakalayarak kullanıcının niyetini daha iyi anlama ve özel kelime dağarcığını tanıma yeteneğine sahip. Ayrıca canlı dil geçişlerini ve kesintisiz akış transkripsiyonunu da destekliyor. Çoklu konuşmacı atfı ve kelime düzeyinde zaman damgaları sunan model, Artificial Analysis ölçümlerine göre Chirp 3'e kıyasla nihai transkripsiyon süresini %70 oranında iyileştiriyor. FLEURS karşılaştırmasında ise çok dilli performansta önemli gelişmeler kaydederek, akış modunda %5.50, akışsız kullanım senaryolarında ise %5.04'lük bir kelime hata oranı (WER) sunuyor.

Google Antigravity ve Gboard gibi günlük kullanılan yüzeylere entegre edilen 3.5 Transcribe, bağlama duyarlı anlayışıyla nüansları, niyetleri ve satır içi düzenlemeleri kolayca yakalıyor. Vivo, Intellitek Health ve Lingopal gibi şirketler, modelin düşük gecikme süresi, doğruluğu ve geniş dil desteği hakkında olumlu geri bildirimler paylaştı. Bu gelişmeler, sesli teknolojilerin geleceği için heyecan verici potansiyeller sunuyor.

Bunlara da göz at