Nvidia’nın Yeni Çıkarım Mimarisi Cerebras Karşısında İlk Sonucunu Aldı
Nvidia’nın Groq teknolojisine yaptığı 20 milyar dolarlık yatırımın ilk büyük performans göstergeleri ortaya çıkarken şirketin Groq 3 tabanlı LPX sistemleri, Gemma 4 31B modelinde saniyede 3.400 token üretimine ulaştı. Artificial Analysis tarafından yapılan bağımsız testte elde edilen sonuç, aynı koşullarda 882 token/s üreten Cerebras sisteminin yaklaşık dört katına karşılık geldi. Nvidia’nın asıl hedefi ise tek başına LPU performansından ziyade GPU ile LPU’ların birlikte kullanıldığı yeni nesil yapay zekâ çıkarım mimarisini ölçeklendirmek olarak öne çıkıyor.
Groq 3 Tabanlı LPX Sistemleri Çıkarım Performansında Yeni Bir Sonuç Ortaya Koydu
Artificial Analysis tarafından gerçekleştirilen testte Nvidia LPX sistemi, Google’ın Gemma 4 31B modeliyle 100.000 tokenlık giriş dizisi kullanılırken 3.400 token/s performans gösterdi. Aynı test koşullarında Cerebras 882 token/s seviyesinde kalırken Nvidia, kendi sisteminin en yakın rakibe kıyasla yaklaşık dört kat daha hızlı olduğunu belirtiyor.

Nvidia’nın açıkladığı sonuç, yapay zekâ çıkarımında token üretim hızının sistem tasarımındaki önemini yeniden gündeme getiriyor. Daha yüksek token üretim hızı, yapay zekâ ajanlarının aynı zaman aralığında daha fazla işlem yapmasına, daha uzun akıl yürütme zincirleri çalıştırmasına ve kullanıcı etkileşimlerine daha hızlı yanıt vermesine katkı sağlıyor.
Groq tarafından geliştirilen LPU mimarisi, geleneksel veri merkezi GPU’larından farklı olarak büyük ölçüde çip üzerinde bulunan SRAM belleğe dayanıyor. GPU sistemleri GDDR7 veya HBM4 gibi yüksek hızlı harici bellek teknolojilerini kullanırken Groq 3, çıkarım sırasında ortaya çıkan bellek bant genişliği darboğazını azaltmak amacıyla veri akışını SRAM merkezli bir mimari üzerinden yürütüyor.
SRAM yapısı yüksek hız avantajı sağlarken fiziksel alan açısından önemli bir bedel oluşturuyor. Nvidia’nın üst seviye Rubin GPU’su 288 GB yerleşik belleğe sahipken tek bir Groq 3 LPU yalnızca 500 MB SRAM taşıyor ve iki sistem arasındaki kapasite farkı yaklaşık 576 kata ulaşıyor.
Gemma 4 31B gibi bir modelin tek bir LPU belleğine sığmaması, Nvidia’nın LPX tasarımında birden fazla hızlandırıcıyı aynı sistem içinde kullanmasını gerektiriyor. Her LPX rafı 256 adede kadar LPU barındırabilirken toplam SRAM kapasitesi 128 GB seviyesine çıkıyor ve daha büyük modeller için birden fazla raf birbirine bağlanabiliyor.
Modelin farklı hızlandırıcılara dağıtılması, yüksek kapasiteli yapay zekâ modellerinin çıkarım altyapısında paralel işlem tekniklerini daha önemli hale getiriyor. Gemma 4 31B, FP8 hassasiyetinde çalıştırıldığında 31 GB’ın biraz üzerinde bellek gerektirdiği için tek bir LPX rafına rahatlıkla sığarken daha büyük modellerde gereken LPU sayısı hızla yükseliyor.
Gemma 4 31B, parametre sayısı açısından büyük bir model olarak görülmese de yoğun model yapısı testin önemini artırıyor. Model her token üretiminde 31 milyar parametrenin tamamını etkinleştirirken daha büyük Mixture of Experts (MoE) modellerinde toplam parametre sayısı çok daha yüksek olmasına rağmen her işlemde yalnızca belirli parametre grupları kullanılıyor.
DeepSeek V3, 671 milyar toplam parametreye sahip olmasına rağmen token başına yaklaşık 37 milyar aktif parametre kullanıyor. Ancak MoE mimarisinin farklı tokenlarda farklı uzman ağlarını devreye sokması, yoğun modellerde bulunmayan ek veri hareketi ile yönetim maliyetleri oluşturabildiği için Gemma 4 31B testindeki hızın daha büyük modellerde aynı ölçekte korunacağı henüz kesinleşmiş değil.
DeepSeek V3 gibi çok daha büyük bir modelin LPX üzerinde çalıştırılması, model ağırlıklarının dağıtılması nedeniyle çok daha fazla hızlandırıcı gerektiriyor. Mevcut kapasite varsayımlarına göre DeepSeek V3 için yaklaşık 1.342 LPU gerekiyor ve bu miktar beşten fazla LPX rafına karşılık geliyor.
Bu ölçek, Groq mimarisinin yüksek çıkarım hızını büyük modellerde elde ederken altyapı yoğunluğunu da artırabileceğini gösteriyor. Sistem sayısının yükselmesi, yalnızca donanım maliyetini değil ağ bağlantıları, güç tüketimi, raf yönetimi ve model dağıtımının operasyonel karmaşıklığını da büyütüyor.
Nvidia’nın uzun vadeli planı, yapay zekâ çıkarımının tamamını Groq 3 LPU’lara bırakmak yerine GPU ile LPU arasında iş yükünü bölüştürmek üzerine kuruluyor. GPU’lar yoğun hesaplama gerektiren prefill aşamasında istemleri işleyip modelin durumunu takip eden key-value cache yapısını oluştururken LPU’lar bellek bant genişliğinin daha kritik olduğu decode aşamasını üstleniyor.
Rubin GPU’ların yüksek hesaplama yoğunluğu, çok sayıda eş zamanlı kullanıcıya hizmet verilen çıkarım senaryolarında avantaj sağlarken Groq LPU’ların yüksek token üretim hızı etkileşimli kullanım tarafını güçlendiriyor. Nvidia bu iki mimariyi birleştirerek toplam sistem kapasitesi ile kullanıcı başına yanıt hızını aynı altyapıda dengelemeyi hedefliyor.
Nvidia’nın Cerebras karşısında açıkladığı dört katlık performans farkı, 100.000 tokenlık giriş dizisiyle yapılan Artificial Analysis ölçümlerinde destekleniyor. Ancak iki sistemin aynı sayıda hızlandırıcı kullandığı anlamına gelmeyen karşılaştırma, donanım verimliliği açısından daha ayrıntılı bir değerlendirme gerektiriyor.
Cerebras’ın CS-3 sistemleri Gemma 4 31B modelini kullanılan hassasiyet ayarına bağlı olarak bir veya iki 44 GB kapasiteli hızlandırıcıya sığdırabilirken Nvidia’nın aynı modeli için en az 64 LPU gerekiyor. Nvidia’nın daha yüksek token/s sonucu elde etmesi, dolayısıyla tek başına hızlandırıcı başına performans veya toplam donanım verimliliği hakkında kesin bir hüküm vermiyor.
Cerebras’ın WSE-3T tabanlı CS-4 sistemi, şirketin önceki nesil mimarisine kıyasla hesaplama, G/Ç bant genişliği, fabric hızı ve bellek bant genişliği alanlarında iki kat artış hedefliyor. Yeni sistemin raf başına üç kat daha fazla hızlandırıcı barındırması da Cerebras’ın yüksek performanslı çıkarım altyapısındaki ölçek avantajını artırabilir.
Cerebras ayrıca yeni sistemlerini GPU tabanlı altyapılarla birlikte kullanacak heterojen çıkarım yapıları üzerinde çalışıyor. AMD’nin Helios GPU raflarıyla Cerebras hızlandırıcılarını bir araya getiren iş birliği ile AWS tarafındaki benzer çalışmalar, Nvidia’nın GPU artı LPU yaklaşımının rakipler tarafından da farklı donanım kombinasyonlarıyla takip edildiğini gösteriyor.
Nvidia’nın Groq teknolojisine yaptığı yatırımın ticari karşılığını belirleyecek temel unsur, tek bir model üzerinde ulaşılan 3.400 token/s sonucu değil, aynı mimarinin farklı model boyutlarında ve yüksek eş zamanlı kullanıcı yüklerinde ne kadar verimli çalışacağı olacak. Özellikle büyük MoE modellerinde hızlandırıcı sayısının hızla artması, LPX mimarisinin maliyet, güç tüketimi ve operasyon açısından nasıl ölçekleneceğini kritik hale getiriyor.
Yapay zekâ ajanlarının daha uzun akıl yürütme süreçleri yürütmesiyle çıkarım altyapısında düşük gecikme ile yüksek token üretim hızı daha değerli hale gelebilir. Nvidia’nın GPU ile Groq LPU’yu aynı sistem içinde kullanma stratejisi bu değişen talebe yanıt vermeyi amaçlarken Cerebras, AMD ve AWS gibi oyuncuların yeni heterojen sistemleri, Nvidia’nın ilk benchmark avantajının önümüzdeki dönemde yeniden ölçülmesini gerektirecek.










