OpenAI Gerçek Zamanlı Ses Modelleriyle Yeni Nesil Sesli Asistanlara Güç Veriyor

OpenAI, geliştiricilerin ses tabanlı uygulamalar ve asistanlar oluşturması için üç yeni gerçek zamanlı ses modelini API üzerinden kullanıma sundu. GPT-Realtime-2, GPT-Realtime-Translate ve GPT-Realtime-Whisper adını taşıyan bu modeller, daha doğal sesli etkileşimler, canlı çeviri ve düşük gecikmeli konuşma tanıma imkanı sağlıyor. OpenAI gerçek zamanlı ses modelleri sayesinde geliştiriciler artık çok daha yetenekli sesli asistanlar inşa edebilecek.
GPT-Realtime-2 İleri Düzey Sesli Etkileşim Yetenekleri Sunuyor
OpenAI’ın bu lansmandaki en önemli modeli olan GPT-Realtime-2, canlı sesli etkileşimler için tasarlandı. GPT-Realtime-2 ses asistanı yetenekleri arasında bir görevi tamamlamadan önce “bunu kontrol edeyim” gibi kısa ifadeler söyleyebilme, birden fazla aracı aynı anda çağırabilme ve hata durumlarında daha zarif bir şekilde toparlanabilme özellikleri bulunuyor. OpenAI ayrıca modelin bağlam penceresini 32 binden 128 bine çıkarırken özel terimler, özel isimler ve sağlık sektörüyle ilgili kelime dağarcığını daha iyi hatırlama yeteneği kazandırdı.
Geliştiriciler modelin konuşma stilini duruma göre ayarlayabiliyor ve asgari, düşük, orta, yüksek ve çok yüksek olmak üzere beş farklı akıl yürütme seviyesi arasında seçim yapabiliyor. Yeni modelin iyileştirmeleri benchmark sonuçlarıyla da kanıtlanıyor. Yüksek akıl yürütme seviyesinde GPT-Realtime-2, Big Bench Audio testinde yüzde 96,6 puan alırken GPT-Realtime-1.5 aynı testte yüzde 81,4 puanda kalmıştı. Çok yüksek akıl yürütme seviyesinde ise yeni model Audio MultiChallenge talimat takibi testinde yüzde 48,5 puan alarak önceki versiyonun yüzde 34,7 puanını geride bıraktı. OpenAI sesli asistan geliştirme platformu sunan bu modeller sayesinde geliştiriciler artık çok daha kapsamlı ses deneyimleri oluşturabilecek.
GPT-Realtime-Translate modeli, canlı çok dilli ses deneyimleri için geliştirildi. OpenAI ses API modelleri kapsamında bu model, 70’ten fazla giriş dilinden gelen konuşmaları 13 çıkış diline çevirebiliyor. Şirket, modelin kullanıcılar bağlam değiştirse, bölgesel telaffuzlar kullansa veya alana özel kelime dağarcığıyla konuşsa bile anlamı korurken konuşmacının hızına ayak uydurabildiğini iddia ediyor. Gerçek zamanlı çeviri yapay zeka modeli olarak GPT-Realtime-Translate, özellikle uluslararası iş toplantıları ve canlı yayınlar için ideal bir çözüm sunuyor.
👉️ İlginizi Çekebilir: OpenAI ChatGPT İçin Yeni GPT-5.5 Instant Modelini Varsayılan Olarak Tanıttı
GPT-Realtime-Whisper ise düşük gecikmeli konuşmadan metne dönüşüm için inşa edilmiş bir akışlı transkripsiyon modeli olarak öne çıkıyor. Düşük gecikmeli konuşma tanıma teknolojisi sayesinde model, bir kişi konuşurken sesi anında metne dökebiliyor. Bu özellik canlı altyazılar, toplantı notları, ders transkriptleri ve benzeri kullanım senaryoları için büyük kolaylık sağlıyor. Sesli asistan fiyatlandırması da netleşti. GPT-Realtime-2 için milyon ses giriş tokeni 32 dolar, önbelleğe alınmış giriş tokeni 0,40 dolar ve milyon ses çıkış tokeni 64 dolar olarak belirlendi. GPT-Realtime-Translate dakikası 0,034 dolar, GPT-Realtime-Whisper ise dakikası 0,017 dolar olarak fiyatlandırıldı.
✍️ Editörün Notu İçin Tıklayın
✍️ Editörün Notu İçin Tıklayın: OpenAI’ın bu üç yeni modeli, sesli asistanların neredeyse insan gibi konuşmasının önündeki engelleri ciddi şekilde azaltıyor. Özellikle GPT-Realtime-2’nin “bunu kontrol edeyim” gibi ara cümleler kurabilmesi ve hata anında sessizce başarısız olmak yerine toparlanabilmesi, yapay zeka ile konuşmanın doğallığını artıran önemli detaylar. 128 bin tokenlik bağlam penceresi ise uzun sohbetlerde modelin konuyu unutmasını engelliyor. Canlı çeviri modelinin 70’ten fazla dili desteklemesi ve bölgesel aksanlarla başa çıkabilmesi ise küresel işletmeler için büyük bir nimet.









