OpenAI, Siber Güvenlik Yetkinliği Artan Modeller İçin Eğitim Sürecini Yavaşlattı
OpenAI, dahili testlerde gelişmiş siber güvenlik yetenekleri gösteren yeni nesil modeller nedeniyle en ileri eğitim çalışmalarının bir bölümünü geçici olarak yavaşlattı. Şirket, dağıtıma hazırlanılan modellerdeki pekiştirmeli öğrenme çalışmalarına iki haftalık ara verirken en büyük frontier RL eğitim çalışmasını yeni güvenlik kontrolleri tamamlanana kadar askıya aldı. OpenAI daha küçük eğitim çalışmaları ile değerlendirmeleri sürdürerek güvenlik önlemlerini test etmeye devam ediyor.
Astra Testleri Eğitim Altyapısında Yeni Güvenlik Gereksinimleri Oluşturdu
OpenAI’nin Astra üzerindeki dahili değerlendirmeleri, modelin şirketin Preparedness Framework kapsamında kritik siber güvenlik yetenekleri eşiğine yaklaşabileceğine ilişkin endişeleri artırdı. Şirketin çerçevesi siber güvenlik alanında yüksek yetenek seviyesini, operasyonların uçtan uca otomasyonu veya gerçek dünyada kullanılabilir güvenlik açıklarının otomatik keşfi ile ilişkilendiriyor. OpenAI, kritik seviyeye ulaşan yetenekler için gerekli güvenlik kontrolleri belirlenmeden geliştirme sürecinin sürdürülmemesini öngören daha sıkı bir yaklaşım kullanıyor.
Modelin eğitim sırasında ürettiği kodu çalıştırması, dış sistemlere erişmesi veya eğitim altyapısındaki kaynaklarla etkileşime girmesi, dağıtım sonrasındaki kötüye kullanım risklerinden farklı bir güvenlik alanı oluşturuyor. OpenAI, yeni yaklaşımında model geliştirme ortamlarının da model yetenekleriyle birlikte değerlendirilmesi gerektiğini belirtiyor.
OpenAI araştırma altyapısında model tarafından üretilen kodun çalıştırıldığı iş yükleri için daha güçlü sandbox sistemleri devreye aldı. Şirket daha yüksek risk taşıyan iş yüklerinin ağ erişimini de daha fazla izole ederken kalıcı yetkileri azaltıyor, ortak kullanılan bazı servisleri ise güvenlik açığı oluşturabilecekleri gerekçesiyle kaldırıyor.
Güvenlik mimarisindeki değişiklikler, OpenAI’nin model geliştirme ortamlarında savunma katmanlarını artırma yaklaşımıyla örtüşüyor. Preparedness Framework, yüksek yetenekli modeller için ağ segmentasyonu, iş yükü izolasyonu, erişim kontrolü, en az ayrıcalık ilkesi, çok faktörlü kimlik doğrulama ile sürekli izleme gibi kontrolleri güvenlik yaklaşımının parçaları arasında sıralıyor.
OpenAI model izleme sistemini genişleterek örneklenen her token üzerinde çalışan sınıflandırıcıları daha ileri otomatik araştırma sistemleriyle birlikte kullanmaya başladı. İzleme katmanı yetkisiz erişim girişimleri, veri hırsızlığı, yıkıcı işlemler ile güvenlik önlemlerini aşmaya yönelik davranışları belirlemeye odaklanıyor. Şirket, söz konusu izleme altyapısının takip edilen çıkarım hesaplama kapasitesinin yaklaşık yüzde 20’sini tükettiğini belirtiyor.
Token düzeyindeki izleme yaklaşımı, klasik çıktı filtrelerinden daha geniş bir gözlem alanı oluşturuyor. Bir modelin yalnızca son çıktısını incelemek yerine üretim sürecindeki davranış örüntülerini takip eden sistemler, uzun süren otonom görevlerde ortaya çıkabilecek riskli eylemleri daha erken yakalamayı hedefliyor.
OpenAI’nin en büyük planlı frontier RL çalışması, yeni güvenlik gereksinimleri karşılanana kadar askıda tutuluyor. Şirket daha küçük eğitim çalışmaları ile değerlendirmeleri kullanarak yeni kontrollerin gerçek model davranışları üzerindeki etkisini ölçüyor. Astra ile ilişkili bazı eğitim ve değerlendirme iş yükleri güçlendirilmiş güvenlik ortamlarında yeniden başlatılırken önemli sayıda çalışma yeni gereksinimleri karşılayan ortamlara taşınmayı bekliyor.
OpenAI’nin siber güvenlik yaklaşımı, son dönemde modellerin güvenlik araştırmalarında kullanılmasına yönelik çalışmalarla birlikte ilerliyor. Şirketin Preparedness Framework’ü siber güvenliği ayrı bir takip kategorisi olarak ele alırken yüksek yetenek seviyesinde iç kullanım için dahi güçlü güvenlik ile hizalanma kontrolleri öngörüyor.
OpenAI’nin yeni yaklaşımı, güvenlik değerlendirmesinin yalnızca kullanıcıya sunulacak nihai modeli kapsamayacağını gösteriyor. Şirket, eğitim sırasında ortaya çıkabilecek yeni yeteneklerin araştırma ortamlarına erişim biçimiyle birlikte değerlendirilmesini planlıyor. Model geliştirme sürecindeki risklerin daha erken aşamada ele alınması, frontier AI sistemlerinin eğitim altyapısının da güvenlik sınırlarının parçası hâline gelmesine yol açıyor.
Siber güvenlik yetenekleri hızla gelişen modeller açısından eğitim altyapısının korunması, OpenAI’nin önündeki yeni operasyonel başlıklardan biri hâline geliyor. Şirketin bundan sonraki frontier eğitimleri daha sıkı sandbox, ağ izolasyonu, yetki azaltma ve davranış izleme kontrolleriyle ilerletmesi beklenirken en büyük eğitim çalışmasının ne zaman yeniden başlayacağı, yeni güvenlik standartlarının uygulanma hızına bağlı olacak.







