Haberler

Tavus Griffin Tanıtıldı: Yapay Zekâ Artık Konuşurken Dinleyip İnsan Gibi Tepki Verebiliyor

Tavus, görüntülü görüşmelerde karşısındaki kişiyi gerçek zamanlı izleyerek konuşabilen, dinleyebilen ve beden diliyle tepki verebilen yapay zekâ modeli Griffin’i tanıttı. İnsan Etkileşim Modeli (Human Interaction Model – HIM) olarak geliştirilen sistem, konuşma sırasındaki yüz ifadelerini, duraksamaları ve sözlü olmayan iletişim işaretlerini işleyerek eş zamanlı yanıt üretiyor. Tavus’un paylaştığı canlı test sonuçlarında katılımcıların yüzde 48’i Griffin’i gerçek bir insan olarak değerlendirdi.

Griffin, Görüntülü Görüşmelerde İnsan Davranışlarını Gerçek Zamanlı Takip Ediyor

Tavus’un geliştirdiği Griffin, geleneksel sesli yapay zekâ sistemlerinden farklı olarak iletişimi yalnızca konuşma metni üzerinden yürütmüyor. Model, karşısındaki kişinin sesini işlerken yüz hareketlerini, konuşma ritmini ve sessizlik anlarını da değerlendirerek etkileşimin akışına göre tepki veriyor.

Görüntülü iletişim teknolojilerinde yeni bir yaklaşım sunan İnsan Etkileşim Modeli, karşı tarafın cümlesini tamamlamasını bekleyen klasik yanıt mekanizmasının ötesine geçiyor. Griffin, kullanıcı konuşurken başını sallayabiliyor, yüz ifadesindeki değişikliklere karşılık verebiliyor ve uygun gördüğü anlarda konuşmaya katılabiliyor.

Tavus’un açıkladığı deney sonuçları, Griffin-Lite modelinin insan benzeri görüntülü iletişim performansını ortaya koydu. Bir dakika süren görüntülü görüşmelere katılan 54 kişinin 26’sı karşısındaki kişinin gerçek bir insan olduğunu düşündü. Şirketin önceki Phoenix-4.5 tabanlı sistemiyle yapılan karşılaştırmada ise 41 katılımcıdan yalnızca biri aynı değerlendirmeyi yaptı.

Gerçek zamanlı video Turing testi olarak adlandırılan değerlendirme, yalnızca ses kalitesini veya yüz benzerliğini ölçmüyor. Test, yapay zekânın konuşma sırasını yönetme, karşı tarafın davranışlarını algılama ve doğal tepkiler üretme becerilerini de kapsıyor. Bununla birlikte sonuçların Tavus tarafından yürütülen sınırlı katılımcılı bir araştırmaya dayandığı, daha geniş bağımsız testlerin henüz bulunmadığı belirtilmeli.

Griffin’in teknik mimarisi, algılama ile yanıt üretimini ayrı aşamalara bölen geleneksel sistemlerden farklılaşıyor. Tavus, modeli video-video tabanlı tam çift yönlü (full-duplex) bir yapı üzerine kurarken görüntü işleme, ses üretimi, hareket modelleme ve konuşma kararlarını aynı etkileşim döngüsünde birleştiriyor.

Şirketin teknik açıklamasına göre Griffin-Lite, referans görüntüyü, gelen ses akışını ve hareket kontrollerini kullanarak 720p çözünürlükte görüntü üretiyor. Modelin video üretim sistemi, 25 kare/saniye hızında her biri 320 milisaniyelik görüntü parçaları oluştururken NVIDIA H100 grafik işlemcilerinde sesin ekrana yansıyan etkisi ortalama 0,43 saniyede gerçekleşiyor.

Tavus, Griffin’in insanlarla kurduğu gerçekçi iletişimin beraberinde kimlik yanıltma riskleri getirdiğini belirterek genel kullanıma geçişi şimdilik erteliyor. Şirket, Griffin-Lite sürümünü yalnızca seçilmiş test kullanıcılarına açarken yapay zekâ kimliğinin açıkça belirtilmesi ve güvenli kullanım koşullarının geliştirilmesi üzerinde çalışıyor.

İnsan etkileşim modeli yaklaşımı, müşteri hizmetleri, uzaktan eğitim, dijital danışmanlık ve teknik destek gibi alanlarda yeni kullanım senaryoları oluşturabilir. Örneğin bir kullanıcı arızalı cihazını kameraya gösterdiğinde sistem, sözlü açıklamaların yanında görüntüdeki ayrıntıları da değerlendirerek yönlendirme yapabilir. Ancak gerçek insan izlenimi oluşturan dijital avatarların yaygınlaşması, Türkiye’deki işletmeler açısından kullanıcı bilgilendirmesi, kişisel verilerin korunması ve yapay zekâ kaynaklı içeriklerin şeffaf biçimde tanımlanması konularını da gündeme taşıyacak.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu