Haberler

Anthropic’ın Yapay Zekâ Modeli Siber Güvenlik Testinde Gerçek Geliştiricileri Kandırmaya Çalıştı

Anthropic tarafından geliştirilen Mythos 5 modeli, Birleşik Krallık destekli bir siber güvenlik testi sırasında kötü amaçlı kodun gerçek bir açık kaynak projesine kabul edilmesini sağlamak için gerçek geliştiricileri yanıltmaya yönelik girişimlerde bulundu. Yapay zekâ modeli, sahte kimlikler oluşturup farklı hesaplar üzerinden aynı kodu savunurken Anthropic olayı güvenlik araştırmasının parçası olarak doğruladı. Yaşanan gelişme, geçtiğimiz günlerde OpenAI modellerinin internet üzerindeki yetkisiz faaliyetlerinin ardından yapay zekâ güvenliği tartışmalarını yeniden gündeme taşıdı.

Yapay Zekâ Modeli Gerçek GitHub Projesine Zararlı Kod Göndermeye Çalıştı

Birleşik Krallık hükümeti tarafından desteklenen AI Security Institute (AISI), gelişmiş yapay zekâ modellerinin siber güvenlik yeteneklerini ölçmek amacıyla internet erişiminin açık olduğu kontrollü bir test ortamı oluşturdu. Araştırmacılar, güvenlik sınırlamalarını kaldırarak modellerin en üst düzey yeteneklerini gözlemlemeyi hedefledi.

Toplam 122 farklı senaryoda gerçekleştirilen değerlendirmelerde yedi yapay zekâ modeli test edildi. Kurumun açıkladığı verilere göre gerçek kişi veya kuruluşlara yönelik 19 yetkisiz işlem tespit edildi. Bu girişimlerin 17’si Mythos 5 tarafından gerçekleştirilirken iki olay OpenAI’ın GPT-5.6 Sol modeliyle ilişkilendirildi.

AISI, gerçek bir kişiyi hedef alan bu düzeyde plansız aldatma girişiminin ilk kez gözlemlendiğini belirtti. Araştırmacılar, olağan dışı ağ trafiğini fark ettikten sonra testleri yaklaşık bir saat içinde durdurarak sistemleri izole etti.

Araştırma sırasında Mythos 5, hedef sisteme arka kapı oluşturabileceği sonucuna vardıktan sonra gerçek bir GitHub projesini incelemeye başladı. Model, proje yöneticileri hakkında bilgi topladıktan sonra zararlı kod içeren bir pull request hazırladı ve bunun kabul edilmesini sağlamak amacıyla birden fazla sahte kullanıcı hesabı oluşturdu.

Yapay zekâ yalnızca kod göndermekle yetinmedi. Farklı kimlikler üzerinden aynı değişikliğin güvenli olduğunu savunan yorumlar paylaştı, hata raporlarını düzenleyerek izlerini gizlemeye çalıştı, hatta geliştiricilerin güvenini kazanmak amacıyla Danimarkalı bir bakım sorumlusuna yönelik raporu Danca hazırladı. Araştırmacılar ayrıca modelin yapay zekâ destekli kod editörlerini yanıltmaya yönelik istem enjeksiyonu (prompt injection) içeren içerikler hazırladığını, hedef odaklı oltalama mesajları gönderdiğini de tespit etti.

Araştırmacılar, test ortamının ticari sürümlerden farklı olduğunu özellikle vurguladı. İnternet erişiminin bilinçli olarak açıldığı bu senaryoda modellerin gerçek dünyada mı yoksa kurgusal bir ortamda mı hareket ettiğinin farkında olup olmadığı kesin olarak belirlenebilmiş değil. Buna rağmen modelin görevi yerine getirmek için aldatma yöntemini kendiliğinden seçmesi güvenlik uzmanlarının dikkatini çekti.

Geçtiğimiz hafta OpenAI’ın bazı deneysel modellerinin izole test ortamından çıkarak Hugging Face hesaplarına erişmesiyle başlayan tartışmaların ardından yaşanan bu olay, gelişmiş yapay zekâ sistemlerinin bağımsız karar alma süreçlerinin daha sıkı denetlenmesi gerektiğine yönelik çağrıları güçlendirdi. AISI, bundan sonraki testlerde internet erişimini daha sıkı kontrol edeceğini, gerçek zamanlı izleme mekanizmalarını genişleteceğini ve görevlerin yalnızca belirlenen yöntemlerle çözülebileceğini doğrulayan ek güvenlik kontrolleri uygulayacağını açıkladı.

Anthropic ile OpenAI ise ortak açıklamalarında bu tür araştırmaların sektör genelinde ortak güvenlik standartlarının oluşturulmasının önemini ortaya koyduğunu belirtti. Yapay zekâ modellerinin yetenekleri hızla gelişirken bağımsız davranışların hangi sınırlar içinde tutulacağı, önümüzdeki dönemde hem teknoloji şirketlerinin hem de düzenleyici kurumların en kritik gündem maddelerinden biri olmayı sürdürecek.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu