Anthropic ve Accenture Yapay Zekâ Model Güvenliği İçin 2 Milyar Dolarlık Yatırım Yapacak
Anthropic ile Accenture, gelişmiş yapay zekâ modellerinin bağımsız değerlendirilmesi için önümüzdeki beş yılda en az 2 milyar dolarlık yatırım yapacak. Şirketler, değerlendirme kapasitesinin artırılması için ayrı ayrı en az 1 milyar dolar kaynak ayırırken çalışmalara Accenture bünyesindeki Faculty liderlik edecek. Ortaklık, gelişmiş modellerin güvenliği konusunda düzenleyiciler, araştırmacılar ve şirketler üzerindeki denetim baskısının arttığı dönemde hayata geçirilecek.
Bağımsız Değerlendirme Model Güvenliğini Nasıl Ölçecek?
Anthropic’in San Francisco merkezindeki yapay zekâ geliştirme çalışmalarına eşlik edecek değerlendirme ekibi, şirketin ileri seviye modellerini doğrudan test edecek. Faculty uzmanları, modellerin güvenlik önlemlerini sınarken kırmızı takım çalışmaları yürütecek ve sistemlerin belirlenen güvenlik hedefleriyle ne ölçüde uyumlu davrandığını inceleyecek.
AI model değerlendirmesi, bir sistemin yalnızca görev performansını değil güvenlik sınırlarını da ölçen kapsamlı testlerden oluşuyor. Uzman ekipler, zararlı kullanım senaryoları, beklenmeyen model davranışları, güvenlik bariyerlerinin aşılması ile modelin belirlenen ilkelerden sapması gibi durumları kontrollü ortamda inceleyebiliyor. Anthropic ile Accenture arasındaki ortaklık, söz konusu testlerin şirket dışından gelen uzmanların erişimiyle daha düzenli yürütülmesini hedefliyor.
Anthropic’in “embedded evaluation” olarak adlandırdığı yöntem, bağımsız değerlendiricilerin yapay zekâ şirketinin çalışma ortamına doğrudan dahil edilmesine dayanıyor. Değerlendiriciler çalışanlara benzer erişim seviyesine sahip olurken şirketin model geliştirme süreçlerini, güvenlik uygulamalarını ve ortaya çıkan olayları daha yakından inceleyebilecek.
Bağımsız yapay zekâ denetimi, dışarıdan yapılan sınırlı testlerin göremediği operasyonel sorunların belirlenmesine katkı sağlayabilir. Değerlendiricilerin şirket içindeki süreçleri incelemesi, güvenlik taahhütlerinin uygulamada nasıl karşılandığını kontrol etmelerine de alan açacak. Ekipler ayrıca karşılaşılan olayları raporlayarak kamuoyunun yapay zekâ sistemlerinin yararları ile riskleri hakkında daha kapsamlı bilgi edinmesine katkı sunacak.
Accenture’ın özel yapay zekâ birimi Faculty, ortaklığın teknik çalışmalarını yönetecek. Faculty uzmanları, Anthropic tarafından geliştirilen modeller üzerinde red teaming uygulayarak sistemlerin kötüye kullanım veya güvenlik ihlali karşısındaki davranışlarını sınayacak. Ekip ayrıca alignment değerlendirmeleri gerçekleştirerek modelin insan tarafından belirlenen amaçlarla ne ölçüde uyumlu hareket ettiğini inceleyecek.
Kırmızı takım testleri, güvenlik ekiplerinin bir yapay zekâ sistemini saldırgan veya kötü niyetli kullanıcı perspektifinden sınamasına dayanıyor. Geliştiriciler, test sonuçlarını kullanarak güvenlik bariyerlerindeki açık noktaları belirleyebiliyor. Anthropic ile Accenture’ın planladığı çalışma, söz konusu yöntemi tek seferlik bir test yerine sürekli değerlendirme sürecinin parçası hâline getirmeyi amaçlıyor.
Son dönemde bazı yapay zekâ ajanlarının güvenli çalışma ortamlarının dışına çıkmaya yönelik davranışlar sergilemesi, gelişmiş modellerin denetlenmesi konusunda yeni tartışmalar oluşturdu. Araştırmacılar, daha fazla özerklik kazanan sistemlerin kendi görevlerini planlaması, araçları kullanması ve farklı yazılımlarla etkileşime girmesi nedeniyle klasik model testlerinin kapsamının genişletilmesi gerektiğini değerlendiriyor.
Anthropic CEO’su Dario Amodei de gelişmiş yapay zekâ modellerinin geliştirme hızının yavaşlatılması gerektiğini savunarak bağımsız değerlendiricilerin sistemlere daha geniş erişim sağlaması çağrısında bulundu. OpenAI ise beklenmeyen veya endişe verici model davranışlarını düzenli raporlarla kamuoyuna aktarmaya başlayacağını açıklarken ilk aşamada altı olay raporu yayımladı. Farklı yapay zekâ şirketlerinden gelen bu adımlar, model güvenliği değerlendirmelerinin geliştirme sürecinin yanında ayrı bir denetim alanına dönüşmeye başladığını gösteriyor.
Anthropic ile Accenture’ın beş yıllık yatırım planı, gelişmiş yapay zekâ modelleri için bağımsız güvenlik testlerinin ölçeklendirilmesine ayrılacak. Her iki şirketin en az 1 milyar dolarlık taahhüdü, değerlendirme ekiplerinin kapasitesinin artırılması, uzmanlık alanlarının genişletilmesi ve farklı model geliştiricileriyle ortak çalışmalar yürütülmesi için kullanılacak.
Şirketler, yalnızca kendi ekipleriyle sınırlı kalmayan bir değerlendirme ağı oluşturmayı da planlıyor. Anthropic ile Accenture, başka bağımsız değerlendiriciler ve yapay zekâ geliştiricileriyle benzer çalışma modelleri kurarak farklı sistemlerin daha geniş bir uzman havuzu tarafından incelenmesini hedefliyor. Böyle bir yapı, ilerleyen dönemde model güvenliği standartlarının karşılaştırılabilir testler üzerinden ele alınmasına katkı sağlayabilir.









