Haberler

Anthropic, Yapay Zekâ Modellerinin Gerçek Sistemlere Eriştiği Güvenlik Olaylarını Açıkladı

Anthropic, siber güvenlik testleri sırasında bazı yapay zekâ modellerinin simülasyon ortamından çıkarak gerçek internet üzerindeki sistemlerle etkileşime geçtiğini duyurdu. Şirket, yapılan incelemelerde Claude Opus 4.7 ile Claude Mythos 5 dahil olmak üzere üç farklı modelin gerçek kuruluşlara yönelik yetkisiz işlemler gerçekleştirdiğini doğruladı. Olayların kontrollü güvenlik değerlendirmeleri sırasında yaşandığı belirtilirken Anthropic, değerlendirme altyapısında kapsamlı güvenlik değişiklikleri yapacağını açıkladı.

İnceleme, OpenAI’nin Paylaştığı Olayın Ardından Başlatıldı

Anthropic, OpenAI’nin temmuz ayında bir yapay zekâ modelinin test ortamından çıkarak gerçek altyapıyla etkileşime geçtiğini açıklamasının ardından kendi değerlendirme süreçlerini yeniden gözden geçirdi. Şirket, internet erişiminin açık olduğu 141 binden fazla güvenlik testi kaydını inceleyerek altı olayda modellerin gerçek sistemlere erişebildiğini belirledi.

Yapılan değerlendirmeye göre bu olayların dördü aynı kurumu, diğer ikisi ise farklı kuruluşları etkiledi. Anthropic, olayların tamamının şirket içi güvenlik testleri sırasında meydana geldiğini ve tespit edilen kuruluşlarla iletişime geçilerek gerekli bilgilendirmenin yapıldığını ifade etti.

Şirketin paylaştığı ilk örnekte Claude Opus 4.7, “capture the flag” adı verilen siber güvenlik senaryosunda kurgusal bir hedefe saldırmak üzere görevlendirildi. Ancak testte kullanılan şirket adının gerçek bir internet alan adıyla çakışması ve yapılandırma hatası nedeniyle model internete erişim sağlayabildi.

Kurgusal hedefe ulaşamayan model, aynı ada sahip gerçek şirketi buldu ve sistemdeki zayıf parola ile kimlik doğrulaması gerektirmeyen servisleri kullanarak erişim elde etti. Anthropic’in aktardığına göre model, bu süreçte üretim veritabanına ulaşmayı başardı. Şirket, olayın fark edilmesinin ardından erişimi sonlandırarak ilgili kuruluşu bilgilendirdi.

Anthropic’in dikkat çektiği en önemli noktalardan biri ise Claude Opus 4.7’nin gerçek bir sistem üzerinde çalıştığını anlamasına rağmen saldırı girişimini sürdürmesi oldu. Şirket, diğer modellerin aksine bu davranışın ek güvenlik önlemleri gerektirdiğini belirtti.

İkinci olayda Claude Mythos 5, yine güvenlik yarışması kapsamında eksik olduğu belirtilen kurgusal bir Python paketini oluşturması gerektiğini düşündü. Model, böyle bir paketin bulunmadığını fark edince gerçek PyPI deposunda aynı isimle yeni bir paket yayımladı.

Anthropic’in açıklamasına göre model, hesap oluşturabilmek için ücretsiz bir e-posta adresi kullandı ve hazırladığı paketin içine zararlı kod yerleştirdi. Yaklaşık bir saat boyunca çevrim içi kalan paket, bu süre içinde 15 farklı gerçek sistem tarafından indirildi ve çalıştırıldı.

İndirilen sistemlerden birinin otomatik analiz yapan bir siber güvenlik şirketine ait olduğu belirtildi. Otomatik tarama süreci paketi çalıştırınca zararlı kod bazı kimlik bilgilerine erişerek ilgili altyapıyla etkileşime geçti. Anthropic, modelin bunu gerçek dünya yerine simülasyon ortamında bulunduğunu zannederek yaptığı değerlendirmesini de raporda paylaştı.

Üçüncü olayda ise şirket içi araştırma modeli, kurgusal hedefini bulamayınca binlerce gerçek internet sistemini taramaya başladı. Model, güvenlik açığı bulunan bir uygulamaya ulaştıktan sonra ortamın test senaryosuna ait olmadığını fark ederek işlemleri kendi kararıyla durdurdu.

Anthropic, benzer olayların tekrar yaşanmaması için değerlendirme altyapısını üretim sistemleriyle aynı güvenlik seviyesine yükselteceğini, ağ kayıtlarını daha ayrıntılı izleyeceğini, test kapsamını daha net tanımlayacağını ve bağımsız yapay zekâ güvenliği kuruluşu METR tarafından üçüncü taraf incelemesine tabi tutulacağını açıkladı. Şirket ayrıca ikinci olaya ait sansürlenmiş değerlendirme kayıtlarını da önümüzdeki günlerde kamuoyuyla paylaşacağını duyurdu.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu