2025 boyunca bir gerçekle yüzleştim: yapay zeka entegre bir ürün yaparken asıl bütçe kalemi, şaşırtıcı biçimde, inference maliyetiydi. Modeli seçmek değil. Mimarisini tasarlamak değil. Her API çağrısının cebimden ne götürdüğünü hesaplamak.
Birden fazla adım atan bir ajan kurduğunuzda, her adım bir çağrı, her çağrı bir maliyet demek. Küçük bir pilot proje bile aylık bakkaldan fazla fatura üretebiliyor. "Bunu production'a alalım" diyebilmek için ya müşteri başına maliyeti düşürmek ya da başka bir yol bulmak gerekiyordu.
Mart 2026'da NVIDIA, Vera Rubin platformunu tanıttı. Tek bir sayı dikkatimi çekti: inference token maliyeti, Blackwell'e kıyasla 10 kat düşüyor.
- 50 petaflops FP4 — Blackwell'in 20 petaflopsuna karşı (2,5x ham artış)
- 10x daha ucuz inference token maliyeti (Blackwell baz alındığında)
- 4x daha az GPU aynı eğitim iş yükü için
- TSMC 3nm süreç, HBM4 bellek mimarisi
- 88 milyar dolar — Şubat 2026 global chip satışları (+%62 YoY)
- 500 milyar dolara giden NVIDIA GPU satış hedefi, 2026 sonu
- Rubin Ultra (2027): 100 petaflops — bu sefer iki jenerasyon beklenmiyor
Vera Rubin Nedir, Ne Değiştirdi?
Blackwell'den bu yana en büyük mimari değişiklik şu: NVIDIA artık yalnızca GPU tasarlamıyor. Vera CPU ve Rubin GPU birlikte tasarlanmış, aynı platform içinde koordineli çalışıyor. Neden bu kadar önemli?
Ajanlar, büyük dil modellerinin büyük bağlam pencereleriyle çalışır. Bir ajan görev alır, hafızaya bakar, araç çağırır, sonucu işler, bir sonraki adımı belirler. Bu döngü boyunca CPU ile GPU sürekli veri alışverişi yapıyor. Eskiden bu alışveriş darboğazın kendisiydi — PCIe bant genişliği, gecikme, veri kopyalama. Vera Rubin bu ikisini aynı tasarım altında birleştirerek darboğazı yapısal olarak ortadan kaldırıyor.
Rubin CPX ise ayrı bir kategori: büyük bağlamlı inference için özelleştirilmiş bir GPU sınıfı. Milyonluk token penceresini düşük maliyetle işlemek için optimize edilmiş. Yani hem "1 milyon token bağlam" hem de "bu bağlamı ucuza çalıştırmak" bir arada artık mümkün.
Blackwell ile Karşılaştırma
| Özellik | Blackwell (GB200) | Vera Rubin | Değişim |
|---|---|---|---|
| Ham hesaplama (FP4) | 20 petaflops | 50 petaflops | +%150 |
| Inference token maliyeti | Baz | Baz / 10 | 10x ucuz |
| Eğitim için GPU ihtiyacı | Baz | Baz / 4 | 4x az |
| Bellek | HBM3e | HBM4 | Daha yüksek bant genişliği |
| Üretim süreci | TSMC 4nm | TSMC 3nm | Daha verimli |
| CPU entegrasyonu | Grace (ayrı tasarım) | Vera (ortak tasarım) | Mimari bütünlük |
| Büyük bağlam inference | Standart GPU | Rubin CPX (özel sınıf) | Optimize edilmiş |
Yazılımcı İçin 10x Ucuz Inference Ne Anlama Geliyor?
Soyut kalmayalım. Diyelim ki şu an bir ajan geliştiriyorsunuz ve her çalışma döngüsü 1.000 token inference istiyor. Blackwell tabanlı altyapıda bunun maliyeti X. Vera Rubin'e geçildiğinde aynı iş yükü X/10 ediyor.
Bu sadece maliyet tasarrufu değil — ürün kararları değişiyor:
- Daha sık çağrı: "Kullanıcı her tıkladığında modeli çalıştır" artık hesaplanabilir. Önce "gerekli mi?" diye düşünmek zorunda değilsiniz.
- Daha uzun bağlam: 1M token penceresini her sorgu için açmak, 10x pahalıyken lüks sayılırdı. Artık rutin bir tasarım seçeneği.
- Daha fazla ajan adımı: Çok adımlı reasoning zincirleri, maliyeti 10x düşünce bambaşka bir tablo çiziyor. Daha fazla adım = daha akıllı çıktı = daha iyi ürün.
- Daha küçük startup eşiği: 2025'te inference bütçesi küçük bir ekibin önünde duvardy. Bu duvar önemli ölçüde alçalıyor.
Jeopolitik Boyut: Çin Yarışı
Bu tablonun görünmez bir katmanı var. 2025'te Çinli üreticiler AI hızlandırıcı sunucu pazarının %41'ini aldı. Huawei Ascend 910C, NVIDIA'nın Çin'e satamayana alternatif olarak yerleşiyor. ABD ihracat kısıtlamaları her sıkılaştığında Çin ekosistemi bir adım daha bağımsızlaşıyor.
NVIDIA için bu hem bir kısıt hem bir baskı. Vera Rubin'in hızlı lansmanı ve Rubin Ultra'nın 2027'ye çekilmesi, kısmen bu yarışın sonucu. Platform hızlı değişiyor çünkü durma lüksü yok. Yazılımcılar için çıkarım basit: altyapı seçimleriniz artık yalnızca teknik değil, tedarik zinciri ve jeopolitikle de iç içe.
Şimdi Ne Yapmalısınız?
- Mevcut inference maliyetinizi ölçün: Şu an ne kadar harcıyorsunuz? Bu sayıyı bilmiyorsanız Vera Rubin'in size etkisini hesaplayamazsınız.
- Büyük bağlam window'unu yeniden değerlendirin: 1M token penceresini hangi senaryolarda kullanabilirsiniz? Maliyeti 10x düştüğünde önceden reddettiğiniz kullanım senaryoları yeniden masaya gelebilir.
- Ajan mimarinizin adım sayısını gözden geçirin: Maliyeti azaltmak için kıstığınız adımlar var mıydı? Şimdi bu kısıtlama büyük ölçüde kalktı.
- H2 2026'yı takip edin: Vera Rubin ürünleri bu dönemde piyasaya çıkıyor. Hangi cloud sağlayıcısı önce erişim veriyor? AWS, GCP, Azure fiyatlamasını takip edin.
- Rubin Ultra'yı (2027) radarınıza alın: 100 petaflops ve muhtemelen bir sonraki maliyet düşüşü. Ürün yol haritanızı bu tempoyla senkronize edin.
Son Söz
Inference maliyetinin 10x düşmesi, yapay zekayla ne yapılabileceğine dair sınırları yeniden çiziyor. Bu bir pazarlama iddiası değil — üretim altyapısının değişmesi demek. Ajan çağrısını düşündüğünüzde artık "bu kadar pahalı mı?" yerine "bunu nasıl iyi tasarlayabilirim?" diye sorabilmek, gerçek anlamda farklı bir başlangıç noktası.
2025'in büyük bölümünü inference bütçesi hesaplayarak geçirdiyseniz, 2026'nın ikinci yarısı size farklı bir tablo sunacak. İyi tarafta olmak için şimdiden düşünmeye başlamak mantıklı.
Yorumlar (0)
Henüz yorum yapılmamış. İlk yorumu sen bırak.