Google, Gemini 3.8 Live ile sesli yapay zekayı bir üst seviyeye taşıyor

Google, yeni Gemini 3.8 Live ve 3.8 Live Extended Thinking modelleriyle sesli yapay zeka etkileşimlerini daha doğal ve akıcı hale getiriyor.

WBH Editör24 Eylül 2026 ~2 dk okuma

Google, yapay zeka dünyasında sesli etkileşimleri bambaşka bir boyuta taşıyan iki yeni modelini tanıttı: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Bu modeller, kullanıcıların yapay zeka ile konuşurken çok daha sezgisel ve doğal bir deneyim yaşamasını hedefliyor. Artık cihazlarla konuşmak, gerçek bir sohbet partneriyle konuşur gibi hissettirecek.

Gemini 3.8 Live ve 3.8 Live Extended Thinking, özellikle karmaşık akıl yürütme, gerçek zamanlı görsel bağlam algılama ve arka planda görev yürütme yetenekleriyle öne çıkıyor. Bu sayede, yapay zeka ile konuşurken bir yandan sorular sorup diğer yandan arka planda işlerin halledilmesini sağlayabileceksiniz. Bu yenilikler, Gemini API, Google Workspace ve Gemini uygulaması üzerinden kullanıma sunuldu.

Özellikle Gemini 3.8 Live Extended Thinking, kurumsal düzeyde görev tamamlama ve zeka konusunda dikkat çekiyor. Yapay zeka performans analiz platformu Artificial Analysis'in Speech to Speech Quality Index'inde 82.6 puanla birinci sıraya yerleşen bu model, ayrıca karmaşık iş akışlarında yüksek doğruluk ve sohbet kalitesi dengesi sunuyor. Gemini 3.8 Live ise kullanıcılar arasında büyük beğeni toplayarak Speech Agent Arena'da ikinci sırada yer aldı ve ölçeklenebilirlik için tasarlanmış uygun maliyetli bir çözüm sunuyor.

Bu yeni modeller, görsel girdileri neredeyse gerçek zamanlı işleyebiliyor, konuşma sırasında 97 farklı dil arasında sorunsuz geçiş yapabiliyor ve arka planda araçları veya API çağrılarını yürütürken sohbeti kesintisiz sürdürebiliyor. Örneğin, Gemini 3.8 Live, görsel bağlam kullanarak çalışan eğitimlerinde gerçek zamanlı rehberlik yapabiliyor veya satranç oynarken görsel verileri yorumlayabiliyor. 3.8 Live Extended Thinking ise daha derin akıl yürütme gerektiren görevlerde eş zamanlı olarak hem düşünebiliyor hem de konuşabiliyor, böylece kullanıcıya karmaşık süreçlerde doğal bir şekilde rehberlik ediyor.

Google, bu modelleri geliştiricilere ve işletmelere güvenilir ve üretim için hazır sesli ajanlar oluşturmaları için temel yapı taşları olarak sunuyor. Agora, Fishjam, LangChain gibi platformlar, Gemini Live API'yi kullanarak geliştiricilerin yüksek performanslı, sesle çalışan arayüzler geliştirmesine olanak tanıyor. Salesforce, Genspark ve Lumeris gibi şirketler de bu yeni modellerin düşük gecikme süresi, akıcılık ve araç çağırma yeteneklerinden oldukça etkilenmiş durumda. Ayrıca, yapay zeka tarafından üretilen tüm sesler, dezenformasyonu önlemek amacıyla SynthID ile filigranlanıyor.

Bunlara da göz at