Microsoft, Gerçek Zamanlı Sesli Yapay Zekâ İçin Üç Yeni Modelini Tanıttı
Microsoft, gerçek zamanlı konuşma sistemlerine yönelik üç yeni ses yapay zekâ modelini kullanıma sundu. MAI-Transcribe-2-Streaming, MAI-Voice-2.1 ve MAI-Voice-2.1-Flash adlarını taşıyan modeller, düşük gecikmeli konuşma tanıma ve ses üretimi işlemlerine odaklanıyor. Şirket, yeni transkripsiyon modelinin kısmi ve tamamlanmış metin doğruluğunda Artificial Analysis sıralamasında ilk sırada yer aldığını belirtirken ses üretiminde hız ve maliyet avantajları da sunuyor.
MAI-Transcribe-2-Streaming Konuşmayı 100 Milisaniyede Metne Aktarmaya Başlıyor
Microsoft’un yeni gerçek zamanlı konuşma tanıma modeli MAI-Transcribe-2-Streaming, ses kaydının tamamlanmasını beklemeden metin üretmeye başlıyor. Model, ses verisini aldıktan yaklaşık 100 milisaniye sonra ilk transkripsiyon parçalarını oluşturuyor ve konuşma ilerledikçe önceki sonuçları yeni bağlama göre güncelliyor.
Geleneksel ses transkripsiyonu sistemleri, çoğunlukla konuşma tamamlandıktan sonra nihai metni oluşturuyor. Akış tabanlı konuşma tanıma yaklaşımı ise sesin işlenmesiyle metin üretimini eş zamanlı yürüttüğü için canlı toplantılar, sesli asistanlar ve otomatik altyazı sistemlerinde gecikmeyi azaltıyor.
MAI-Transcribe-2-Streaming, 60 dili desteklerken otomatik dil algılama özelliğiyle konuşmanın hangi dilde gerçekleştiğini sürekli takip ediyor. Microsoft, Artificial Analysis değerlendirmesinde modelin geçici ve nihai transkript doğruluğu bakımından ilk sırada bulunduğunu ileri sürüyor.
Şirketin dikte ve altyazı testlerinde yeni model, en yakın rakibine kıyasla kelimeleri transkriptte iki kat daha hızlı gösterdi. Microsoft, akış tabanlı sürümün ses işleme ücretini 2026 sonuna kadar sesin her saati için 0,54 dolar olarak belirledi. Önceki MAI-Transcribe-2 modelinin tanıtım fiyatı ise saat başına 0,10 dolar seviyesindeydi.
Microsoft’un yeni metinden konuşmaya modeli MAI-Voice-2.1, 26 yerel dil seçeneği kapsamında 23 dili destekliyor. Sistem, aynı ses kimliğini koruyarak farklı dillerde konuşma üretebiliyor ve her dilde doğal aksana yakın bir seslendirme gerçekleştirmeyi hedefliyor.
Çok dilli ses sentezi, özellikle uluslararası müşteri hizmetleri ve dijital asistanlar için önem taşıyor. Bir şirket, farklı ülkelerdeki müşterilerine aynı sanal temsilci kimliğiyle yanıt verirken her dil için ayrı bir ses profili oluşturma ihtiyacını azaltabiliyor.
Microsoft, MAI-Voice-2.1 modelinin fiyatını bir milyon karakter başına 22 dolar olarak açıkladı. Model, şirketin daha önce tanıttığı MAI-Voice-2 ailesinin devamı niteliğini taşıyor. Önceki modeller, Dynamics 365 Contact Center ve Azure Voice Live gibi Microsoft hizmetlerinde de kullanılıyordu.
Microsoft’un MAI-Voice-2.1-Flash modeli, yoğun istek alan ve hızlı yanıt gerektiren sesli uygulamalar için geliştirildi. Şirket, modelin yaklaşık 150 milisaniyelik uçtan uca gecikmeyle 45 saniyelik ses üretebildiğini ve karşılaştırılan modellere göre çıkarım işlemini yüzde 55 daha hızlı gerçekleştirdiğini belirtiyor.
MAI-Voice-2.1-Flash, bir milyon karakter başına 15 dolar fiyatlandırılıyor. Microsoft, benzer modellerle karşılaştırıldığında yaklaşık yüzde 60 maliyet avantajı sunduğunu da iddia ediyor. Bu fiyatlandırma, yüksek hacimli sesli etkileşimleri yöneten işletmeler açısından toplam işlem maliyetini değerlendirmede önemli bir ölçüt oluşturuyor.
Her iki yeni ses modeli de yalnızca birkaç saniyelik referans ses kullanarak ses klonlama desteği sunuyor. Ses klonlama teknolojisi, belirli bir konuşmacının ses özelliklerini taklit eden çıktılar üretebildiği için şirketlerin kullanım izni, kimlik doğrulama ve kötüye kullanım önleme süreçlerini de planlaması gerekiyor.
Microsoft, üç yeni modeli Microsoft Foundry, MAI Playground ve Vercel üzerinden erişime açtı. MAI-Voice ailesi ayrıca OpenRouter üzerinden kullanılabiliyor; LiveKit entegrasyonunun ise ilerleyen dönemde sunulması planlanıyor.
Azure Voice Live üzerinden de değerlendirilebilen modeller, gerçek zamanlı sesli ajanların konuşmayı algılama, yanıt hazırlama ve sesli karşılık üretme aşamalarını aynı altyapıda bir araya getirmeyi hedefliyor. Böyle bir mimari, müşteri temsilcisi botları, toplantı altyazıları ve sesle çalışan kurumsal asistanların yanıt sürelerini doğrudan etkiliyor.
Microsoft’un MAI ailesine yaptığı yatırım, şirketin yalnızca üçüncü taraf yapay zekâ modellerini sunan bir bulut sağlayıcısı olmanın ötesinde kendi temel modellerini geliştirme stratejisini de genişletiyor. Özellikle gecikme, doğruluk ve işlem maliyetinin birlikte değerlendirildiği sesli yapay zekâ pazarında yeni modellerin gerçek performansı, bağımsız testler ve üretim ortamındaki kullanım sonuçlarıyla daha net ortaya çıkacak.









