Google, Doğal Konuşma Dilini Metne Dönüştüren Gemini 3.5 Transcribe Modelini Duyurdu
Google, insanın konuşma esnasındaki duraksama ve kendini düzeltme gibi doğal alışkanlıklarını yüksek hassasiyetle anlayan yeni nesil ses modeli Gemini 3.5 Transcribe’ı kullanıma sundu.

Sesli komutlar ve konuşmayı metne dökme teknolojileri günlük hayatımızın ayrılmaz bir parçası haline gelse de, insanın doğal konuşma akışındaki duraksamalar, duraklamalar ve anlık düzeltmeler bu sistemler için her zaman büyük bir engel teşkil etti. Google, bu sorunu kökten çözmeyi hedefleyen yeni nesil konuşmadan metne dönüştürme modeli Gemini 3.5 Transcribe’ı resmi olarak duyurdu. Şirketin bugüne kadar geliştirdiği en yüksek hassasiyete sahip ses modeli olarak konumlandırılan bu yeni teknoloji, dağınık ve kusurlu konuşmaları dahi son derece temiz ve anlamlı metinlere dönüştürebiliyor.
Kusursuz Değil, Doğal Konuşmayı Anlayan Yapı
Geleneksel ses tanıma sistemleri genellikle kullanıcıdan tane tane, duraksız ve dil bilgisi açısından kusursuz konuşmasını beklerdi. Ancak Gemini 3.5 Transcribe bu yaklaşımı tamamen değiştiriyor. Model; günlük dilde farkında olmadan sıkça kullandığımız “ııı”, “eee” gibi dolgu seslerini otomatik olarak metinden temizliyor.
Daha da önemlisi, konuşma esnasında yapılan anlık cümle düzeltmelerini başarıyla kavrayabiliyor. Örneğin bir kullanıcı sesli yazma esnasında “Toplantıyı Salı günü yapalım, hayır pardon, Çarşamba gününe alalım” dediğinde model, kullanıcının son kararını algılayarak metne doğrudan Çarşamba bilgisini işliyor. Böylece kullanıcıların cümlelerini zihinlerinde önceden kurgulama veya mükemmel bir diksiyonla konuşma zorunluluğu ortadan kalkıyor.
Düşük Hata Oranı ve Çoklu Konuşmacı Desteği
Google’ın paylaştığı teknik verilere bakıldığında Gemini 3.5 Transcribe modelinin sunduğu performans metrikleri oldukça dikkat çekici:
- Düşük Kelime Hata Oranı (WER): Canlı ses akışlarında yalnızca %4, önceden kaydedilmiş ses dosyalarında ise %2,6 gibi oldukça iddialı hata oranlarına ulaşıyor.
- Geniş Dil ve Aksan Desteği: 85’ten fazla dili destekleyen model; bölgesel aksanları, sektörel terimleri ve uzmanlık alanlarına özgü jargonu yüksek doğrulukla tanıyabiliyor.
- Çoklu Konuşmacı Ayrımı (Diarization): Üç farklı konuşmacıya kadar sesleri bir kayıtta ayırabiliyor ve metne anlık zaman damgaları ekleyebiliyor.
Bu gelişmiş özellikler, özellikle toplantı notlarının otomatik tutulması, röportaj deşifreleri ve ses odaklı yapay zeka girişimleri için büyük bir entegrasyon potansiyeli taşıyor.
Gemini Audio Ekosistemi ve Platform Entegrasyonları
Gemini 3.5 Transcribe, tek başına çalışan bir araç olmanın ötesinde Google’ın “Gemini Audio” adını verdiği geniş ses ekosisteminin kritik bir parçası olarak çıkıyor. Bu yapı içerisinde Gemini 3.5 Live ve Gemini 3.5 Live Experimental gibi farklı etkileşim odaklı modeller de yer alıyor.
Yeni ses modeli şimdiden çeşitli platformlarda kullanıma sunulmuş durumda:
- Android ekosisteminde Gboard klavyesinin Rambler dikte özelliğine altyapı sağlıyor.
- macOS platformu için sunulan özel Gemini uygulamasında aktif olarak çalışıyor.
- Yakında geleceği açıklanan Chrome entegrasyonu sayesinde kullanıcılar, web üzerindeki herhangi bir metin alanında doğrudan konuşarak yazı yazabilecek.
Google’ın bu yeniliği, insan-bilgisayar etkileşiminde sesli arayüzleri çok daha doğal ve verimli bir seviyeye taşıyor.


