Sesli Yapay Zekada Yeni Dönem: Google, Gemini 3.8 Live Serisini Erişime Açtı
Google, gerçek zamanlı sesli iletişim ile arka planda karmaşık akıl yürütme yeteneklerini birleştiren yeni Gemini 3.8 Live modellerini duyurdu.

Yapay zeka dünyasında sesli asistanlar ve gerçek zamanlı etkileşim yarışı hız kesmeden devam ediyor. Arama devi Google, geliştirdiği yeni nesil Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleriyle sesli yapay zeka alanında gecikme süresini (latency) minimuma indirmeyi hedefliyor. Geliştiriciler ve girişimciler için yeni imkanlar sunan bu modeller, sesli sohbet akışını bozmadan arka planda karmaşık kodlar ve API çağrıları çalıştırabilmesiyle öne çıkıyor.
Kesintisiz İletişim ve Arka Plan İşlemleri
Geleneksel sesli asistanlarda sıkça karşılaşılan duraksama ve yanıt bekleme süreleri, Gemini 3.8 Live ile büyük oranda tarih oluyor. Yeni mimari, kullanıcıyla doğal bir diyalog sürdürülürken eş zamanlı olarak arka planda veri çekme, API tetikleme ve araç kullanımı gerçekleştirebiliyor. Kullanıcı sohbet etmeye devam ederken, sistem yapılan işlemlerin durumunu yine sesli bir şekilde kullanıcıya bildirebiliyor.
Özellikle karmaşık görevler için tasarlanan Extended Thinking (Gelişmiş Akıl Yürütme) sürümü, çok adımlı problem çözme yeteneğine sahip. Bu sayede model, kullanıcıdan aldığı karmaşık bir talebi parçalara bölerek işlerken konuşma ritmini ve doğallığını bozmadan yanıt üretebiliyor.
97 Dilde Görsel ve Sesli Girdi Desteği
Gemini 3.8 Live modellerinin öne çıkan bir diğer kritik özelliği ise çok dilli ve çok modlu (multimodal) yapısı. 97 farklı dili anlama ve bu dillerde ses üretebilme kabiliyetine sahip olan sistem, konuşma anında kullanılan dili otomatik olarak tespit edip diller arasında pürüzsüz geçiş yapabiliyor.
Bunun yanı sıra gerçek zamanlı görsel işleme kapasitesi sayesinde, kameradan veya ekrandan gelen anlık görüntüler doğrudan sesli yanıtların bağlamına dahil ediliyor. Öne çıkan bazı etkileyici kullanım senaryoları şunlar:
- Kağıttan Kod Üretimi: El çizimi taslakların ve anlık görsel geri bildirimlerin canlı React bileşenlerine dönüştürülmesi.
- Çok Adımlı Asistanlık: Sohbet kesilmeden karmaşık restoran ve uçak bileti rezervasyonlarının tamamlanması.
- İş Uyum Süreçleri: Şirket içi oryantasyon süreçlerinde görsel dökümanlar üzerinden anlık soru-cevap desteği.
- İnteraktif Oyunlar: Satranç gibi görsel ve stratejik oyunların canlı olarak oynanabilmesi.
Performans Metrikleri ve Geliştirici Erişimi
Yapay zeka performans ölçümlerinde dikkat çekici sonuçlara imza atan Extended Thinking modeli, Konuşmadan Konuşmaya Kalite İndeksi (Speech to Speech Quality Index) testlerinde 82,6 puan alarak sektördeki güçlü rakiplerini geride bırakmayı başardı. Standart model ise ses odaklı yapay zeka ajanları sıralamasında zirveye yakın bir konumda yer aldı.
Güvenlik tarafında ise üretilen tüm ses içeriklerine, yapay zeka tarafından oluşturulduğunu doğrulayan filigran teknolojisi SynthID entegre edildi.
Geliştiriciler ve kurumsal şirketler; Gemini API, Google AI Studio ve Gemini Enterprise kanalları üzerinden yeni modellere erişim sağlayabiliyor. Ayrıca Workspace ekosistemindeki Docs, Gmail ve Keep uygulamalarına da entegrasyonlar sunuluyor.
Maliyet tarafında ise standart model için dakika başına ses girdisi 0,005 dolar, ses çıktısı ise 0,018 dolar olarak fiyatlandırıldı. Akıl yürütme token'ları ve görsel girdiler ise kullanım hacmine göre ayrıca ücretlendiriliyor.

