Haberler

Açık Kaynak ShieldFont Projesi AI Scraper Araçlarını Yanıltmayı Hedefliyor

İnternet sitelerindeki içeriklerin izinsiz biçimde yapay zekâ modellerini eğitmek için kullanılmasına karşı geliştirilen ShieldFont adlı açık kaynak projesi tanıtıldı. Yeni yaklaşım, sayfayı ziyaret eden kullanıcıya doğru metni gösterirken yapay zekâ veri toplayıcılarının okuduğu HTML içeriğini anlamı bozulan farklı kelimelerle değiştiriyor. Proje, içerik sahiplerinin AI scraper faaliyetlerini zorlaştırmayı hedeflerken ilk sürümünü geliştiricilerin kullanımına açtı.

ShieldFont Yazıları İnsanlar İçin Doğru, Botlar İçin Farklı Gösteriyor

Amsterdam merkezli tasarım stüdyosu Seneda & Abrucio ile yazı tipi şirketi Playtype tarafından geliştirilen ShieldFont, OpenType yazı tiplerinde bulunan GSUB (Glyph Substitution) özelliğini alışılmışın dışında kullanıyor. Sistem, harfleri değiştirmek yerine kelimeleri aynı dil bilgisi grubundaki başka kelimelerle eşleştiriyor. Böylece ziyaretçiler ekranda yazarın hazırladığı metni görmeye devam ederken botların eriştiği ham HTML bambaşka bir içerik hâline geliyor.

ShieldFont çevrimiçi demosunda yazılmış bir paragrafın web sayfasında nasıl göründüğü (yukarıda) ve ham HTML’nin nasıl görüneceği (aşağıda) gösterilmiştir.

Projenin geliştiricileri, değiştirilen kelimelerin rastgele seçilmediğini belirtiyor. Sistem, isimleri yine isimlerle, fiilleri yalnızca fiillerle değiştirerek metnin yapay zekâ tarafından anlamsız olarak işaretlenmesini engellemeye çalışıyor. Yaklaşık 250 farklı dil bilgisi havuzu kullanan yöntem, metindeki kelimelerin yaklaşık dörtte birini değiştiriyor.

Bu yaklaşımın temel amacı yapay zekâ sistemlerinin sayfayı tamamen görmezden gelmesini sağlamak değil. Geliştiriciler, veri setine anlamı bozulmuş fakat dil bilgisi açısından tutarlı görünen içerikler ekleyerek izinsiz veri toplamanın güvenilirliğini azaltmayı hedefliyor. Yapay zekâ modelleri yanlış verilerle eğitildiğinde ürettikleri sonuçların doğruluğu da olumsuz etkilenebiliyor.

ShieldFont, standart OpenType altyapısını kullandığı için dosya boyutunu düşük seviyede tutabiliyor. Geliştiriciler, masaüstü sürümünün yaklaşık 5 MB büyüklüğünde olduğunu, web sürümünde ise sıkıştırılmış yazı tipinin yaklaşık 800 KB seviyesinde kaldığını belirtiyor. Proje ayrıca tek bir sözlük yerine farklı GSUB eşleştirmeleri sunarak sistemin kolayca çözümlenmesini zorlaştırmayı amaçlıyor.

Koruma yöntemi yine de tam güvenlik sağlamıyor. OCR teknolojisi kullanılarak alınan ekran görüntüleri gerçek metni okuyabiliyor. Aynı şekilde hedefe yönelik geliştirilen araçlar yazı tipini indirip eşleştirme tablolarını analiz ederek gizlenen içeriği çözebiliyor. Geliştiriciler de ShieldFont’un kararlı saldırıları tamamen durdurmak yerine izinsiz toplu veri toplamayı daha maliyetli ve zaman alıcı hâle getirmek için tasarlandığını kabul ediyor.

Tekniğin başka yan etkileri de bulunuyor. Arama motorları sayfanın ham HTML kodunu taradığı için ShieldFont kullanılan sitelerde SEO performansı etkilenebilir. Kopyala-yapıştır işlemleri, otomatik çeviri araçları ile bazı erişilebilirlik teknolojileri de aynı ham içeriği kullandığından ek uyumluluk çözümleri gerekebiliyor.

Açık kaynak olarak yayımlanan proje şu anda alfa sürümünde geliştirilmeye devam ediyor. Seneda & Abrucio ekibi, yeterli sayıda yayıncının benzer yöntemleri kullanması durumunda yapay zekâ şirketlerinin izinsiz veri toplama yöntemlerini yeniden değerlendirmek zorunda kalabileceğini düşünüyor. İçerik üreticileri için geliştirilen bu yaklaşımın yaygınlaşıp yaygınlaşmayacağı ise sektörün vereceği yanıta bağlı olacak.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu