Haberler

ORCA Testi Büyük Modellerin Matematikte Zayıf Kaldığını Gösterdi

Yapay zekâ alanında geliştirilen en güçlü modellerin matematiksel işlem performansı ORCA testiyle yeniden sorgulandı. Uluslararası bir araştırma ekibi tarafından hazırlanan değerlendirme seti büyük dil modellerinin matematiksel akıl yürütmede ciddi hatalar yaptığını ortaya koydu. Araştırmacılar doğal dil üzerinden sorulan 500 hesaplama sorusunu farklı alanlarda sınıflandırdı. Sonuçları incelediğinde büyük modellerin yarıdan fazlasında tutarsızlık görüldü.

ORCA Testi Matematiksel Akıl Yürütme Açığını Ortaya Koydu

Araştırma ekibi ORCA testini finans, fizik, istatistik, biyoloji, mühendislik, sağlık ve temel matematik başlıklarından oluşan geniş bir yelpazeye yaydı. Test sonuçları Gemini 2.5 Flash, Grok 4, DeepSeek V3.2, ChatGPT-5, Claude Sonnet 4.5 gibi modellerin 45 ile 63 arasında değişen doğruluk oranlarına sahip olduğunu gösterdi. Araştırmacılar hataların ağırlıklı olarak yuvarlama kaynaklı olduğunu ifade etti. İşlem adımlarında kopukluk olduğunu belirten ekip büyük modellerin doğal dilde güçlü görünmesine rağmen sayı işlemlerinde tutarlı davranmadığını vurguladı.

Ekip birçok yaygın test setinin eğitim verilerine karıştığını ifade etti. Bu durumun modelleri ezbere yönlendirdiğini belirten araştırmacılar ORCA testinin bu nedenle hazır veri şablonlarından ayrılan bir yapıda tasarlandığını açıkladı. Testte kullanılan sorular gerçek teknik hesaplamalar barındırdı. Oxford Üniversitesi tarafından paylaşılan veriler büyük modellerin insan ortalamasının altında kaldığını doğruladı.

Gemini 2.5 Flash testin genelinde en yüksek puanı aldı. Grok 4 puan farkını düşük seviyede tuttu. DeepSeek V3.2 belirli kategorilerde yüksek skorlar elde etti. Biyoloji ile fizik başlıklarında düşük sonuçlar dikkat çekti. Claude Sonnet 4.5 tüm başlıklarda düşük düzeyde kaldı. ChatGPT-5 ise orta sırada yer aldı. Modellerin bir kısmı doğru cevabı alternatif seçenek olarak verse de kararsızlık genel performansı aşağı çekti.

Araştırmacılar ORCA testinin makine öğrenimi modellerinin hesaplama kabiliyetini ölçmede daha gerçekçi bir rol üstlendiğini ifade etti. Sonuçlar doğal dil yetkinliğinin matematiksel doğruluğa otomatik olarak yansımadığını ortaya koydu. Akademik değerlendirmeler daha tutarlı test araçlarının geliştirilmesi gerektiğini vurguladı.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu