Haberler

Mikrodenetleyiciler İçin Yapay Zekâda Yeni Bir Dönem Başlıyor

Bir geliştirici, 10 doların altında satılan ESP32-S3 mikrodenetleyici üzerinde küçük bir dil modelini yerel olarak çalıştırmayı başardı. GitHub’da paylaşılan proje, saniyede yaklaşık 9,88 token üreterek düşük maliyetli gömülü donanımlarda üretken yapay zekânın çalışabileceğini gösterdi. Deneme, büyük dil modellerinin bu cihazlarda kullanılabileceği anlamına gelmese de yapay zekâ optimizasyonu alanında dikkat çeken bir teknik gösterim olarak öne çıktı.

Projeyi geliştiren SlvDev, Microsoft Research tarafından geliştirilen TinyStories modelini temel aldı. Yaklaşık 28,9 milyon parametreye sahip model, standart 16 bit hassasiyetle yaklaşık 60 MB bellek gerektiriyor. ESP32-S3 ise yalnızca 520 KB SRAM ile 8 MB PSRAM kapasitesine sahip olduğu için model doğrudan çalıştırılamıyordu.

Geliştirici ilk aşamada nicemleme (quantization) yöntemini kullanarak model ağırlıklarının hassasiyetini düşürdü. Böylece bellek ihtiyacı yaklaşık yüzde 75 azaltılarak 14,9 MB seviyesine indirildi. Ardından Google’ın Gemma modellerinde kullanılan katman başına gömme (Per-Layer Embedding – PLE) tekniği uygulandı. Bu yöntem sayesinde model ağırlıklarının büyük bölümü flaş belleğe taşındı, çalışma sırasında yalnızca kritik veriler RAM üzerinde tutuldu.

Bu optimizasyonların ardından modelin aktif bellekte ihtiyaç duyduğu alan yaklaşık 2 MB seviyesine kadar düştü. Çıktı katmanı, gömme verileri ile KV önbelleği PSRAM üzerinde çalışırken ara hesaplamalar mikrodenetleyicinin dahili SRAM alanında gerçekleştirildi.

Projede kullanılan TinyStories modeli yalnızca kısa ve basit metinler üretebiliyor. Kod yazma, gelişmiş sohbet sistemi oluşturma veya yapay zekâ ajanı çalıştırma gibi görevler için yeterli kapasite sunmuyor. Buna rağmen saniyede yaklaşık 9,88 token üretim hızına ulaşılması, düşük güç tüketen donanımlarda yerel yapay zekâ uygulamalarının geleceği açısından önemli bir teknik gösterim olarak değerlendiriliyor.

Benzer yaklaşımlar bugün Raspberry Pi, akıllı telefonlar ile daha güçlü tek kart bilgisayarlarda çok daha gelişmiş modellerin çalıştırılmasını da mümkün hâle getiriyor. Google’ın Gemma 4-E2B-it modeli de nicemleme ile PLE tekniklerini kullanarak milyarlarca parametreyi yaklaşık 1 GB bellek içerisinde çalıştırabiliyor. Bu yaklaşım, bulut bağlantısına ihtiyaç duymadan çalışan sohbet botları, yerel yapay zekâ asistanları ile gizlilik odaklı uygulamaların yaygınlaşmasını destekleyen önemli teknolojiler arasında yer alıyor.

Mikrodenetleyiciler yakın gelecekte büyük dil modellerini çalıştıracak donanımlar olmayacak. Buna karşın enerji tüketimi düşük cihazlarda optimize edilmiş yapay zekâ modellerinin kullanılabilmesi, IoT sistemleri, akıllı sensörler, endüstriyel otomasyon çözümleri ile uç bilişim (edge AI) uygulamalarının gelişimi açısından yeni araştırma alanlarının önünü açıyor.

İlgili Makaleler

Bir yanıt yazın

Başa dön tuşu