AlphaEvolve: DeepMind'in Gemini Ajanı Google Altyapısını Kendi Optimize Etti — Bir Yıllık Üretim Saha Notları (Mayıs 2026)

0 yorum 897 görüntülenme

Teknoloji Gemini AlphaEvolve DeepMind Yapay Zeka Ajanı TPU Algoritma Keşfi Self-Improving AI Üretim ML Sistemleri

11 dk okuma 2177 kelime

Yapay zekânın kendi altyapısını kendi optimize ettiği ana, soyut bir gelecek değil; 2026 Mayısında yalın bir üretim metriği. DeepMind 7 Mayıs 2026'da yayımladığı retrospektifte, evrimsel kodlama ajanı AlphaEvolve'un Google'ın iç altyapısında bir yıldan uzun süre kesintisiz çalıştığını ve ölçülebilir kazançlar ürettiğini açıkladı. Bu, bir benchmark sonucu ya da demo değil; üretim ortamında sürekli ölçülen bir performans hattı.

İlk duyurudan tam 358 gün geçti (14 Mayıs 2025'te DeepMind blogu + arXiv 2506.13131 paper'ı). Bu süre içinde AlphaEvolve, Borg veri merkezi orkestratöründe Google'ın küresel compute kapasitesinin %0,7'sini sürekli geri kazandı, Pallas dilinde yazılmış bir Gemini training kernel'ında %23 hız artışı sağladı (toplam Gemini eğitim süresinde %1 azalma), FlashAttention GPU kernel'ında %32,5 hızlanma üretti, ve yaklaşan bir TPU'nun Verilog devresine — Gemini'nin donanıma yaptığı ilk doğrudan katkı — entegre edildi. 7 Mayıs 2026 update'i bu listeye Spanner LSM-tree compaction'da %20 write amplification azalması, cache replacement policy'sinde aylardan 2 güne inen keşif süresi, ve derleyici (compiler) optimizasyonlarında yazılım depolama ayak izinde ~%9 azalma ekledi.

Bu yazı, sahadaki bir mühendisin gözünden o sayıların ne anlama geldiğini, ne kadarının "vendor-reported" sınırlamasıyla ölçüldüğünü, ve recursive self-improvement tartışmasının gerçekten somutlaşıp somutlaşmadığını yalın biçimde ele alıyor. Söz konusu olan bir model değil; bir ajan. AlphaEvolve, Gemini 2.0 Flash + Gemini 2.0 Pro ensemble'ı mutation operatörü olarak kullanan, otomatik evaluator'lardan beslenen, evrimsel arama yapan bir yazılım kompozitidir. Round 4'te ele aldığımız Gemini 4 + Ironwood TPU sürümü, bu hikayenin donanım katmanıydı; bugün konu o donanımı kullanan ve yeniden tasarlayan ajanın kendisi.

Veri görselleştirme ekranlarında metrik panoları
AlphaEvolve'un üretim panosu — Borg scheduling, Pallas kernel runtime, Spanner compaction, FlashAttention varyans grafikleri yan yana akıyor. Mayıs 2026 itibarıyla 358 günlük canlı veri.

1. AlphaEvolve Nedir: Bir Yıllık Üretim Hikâyesi

AlphaEvolve, 14 Mayıs 2025'te DeepMind tarafından duyurulan ve FunSearch (Nature, 2023) ile AlphaTensor (Nature, 2022) serisinin ardılı olarak konumlanan, evrimsel bir kodlama ajanıdır. Ekibe Matej Balog ile Alexander Novikov öncülük ediyor; arXiv preprint numarası 2506.13131 (Haziran 2025). Açık sonuç deposu github.com/google-deepmind/alphaevolve_results adresinde 279 yıldız aldı, Apache-2.0 lisansı altında matematiksel sonuçların doğrulama not defterlerini barındırıyor.

Önceki sistemlerden temel farkı şudur: FunSearch tek bir fonksiyonu evrimleştirebilirken AlphaEvolve, birden fazla dosya, fonksiyon ve bileşen üzerinde aynı anda kod değişiklikleri önerip test edebiliyor. Bu, gerçek bir codebase'in dokusuna yakın bir kapsam — yani yalnızca akademik problemleri değil, üretim sistemlerini de hedefleyebiliyor.

1 Yıllık üretim deneyiminde sistemin Google içinde kullanıldığı dört kritik katman:

  1. Borg veri merkezi orkestratörü — global compute scheduling heuristic'i
  2. Gemini training kernel'i — Pallas DSL'inde matrix multiplication tiling
  3. TPU Verilog devresi — matrix multiplication unit'inde bit-width azaltma
  4. FlashAttention GPU kernel'i — Transformer dikkat mekanizmasının low-level talimat optimizasyonu

2. Mimari: Gemini Flash + Pro Çift-Model Ensemble

AlphaEvolve'un omurgası beş bileşenden oluşur: bir controller, iki LLM (Gemini 2.0 Flash + Gemini 2.0 Pro), versioned program-memory veritabanı, paralel evaluator worker fleet'i ve hafif bir prompt builder yardımcı script'i. Çift-model stratejisinde Flash genişlik (breadth) sağlıyor — düşük gecikmeyle çok sayıda aday üretiyor; Pro ise derinlik (depth) sunuyor — daha kaliteli ama daha pahalı önerilerle evrimsel aramayı ileri taşıyor.

Pipeline'ın çalışma ritmi VentureBeat'in Sam Witteveen analizinde şöyle özetlenir: Flash hızlı taslaklar atar, Pro bu taslakları derinlemesine inceleyip daha güçlü bir alt küme döndürür. Prompt builder, üç tür bağlamı birleştirir: program-memory'de saklanan önceki kod denemeleri, ekip tarafından yazılmış kurallar/guard rail'ler, ve ilgili dış kaynak materyalleri (paper, developer notes). Her aday önce ucuz unit-test filtrelerinden geçer; hayatta kalanlar daha ağır benchmark'lara ve LLM tabanlı incelemelere alınır. Cascaded evaluation maliyeti düşürür, evaluation caching ise daha önce hesaplanmış programları yeniden çalıştırmaz.

Maliyet açısından dürüst olmak gerek: AlphaEvolve paper'ı "yeni bir çözümün değerlendirilmesi tipik olarak ~100 compute-saat alıyor" diyor (sayfa 8). Yani sistem ucuz değil — ama ölçek olarak Borg %0,7 kazanımı, Google'ın küresel compute footprint'inde milyarlarca dolarlık değer ifade ediyor. Maliyet/fayda bilançosu hyperscaler ölçeğinde fazlasıyla artıda.

Üretim Katmanı Metrik Etki Tarih
Borg / data center scheduling Global compute geri kazanımı %0,7 (sürekli) 2025-05 → bugün
Pallas / Gemini training kernel Kernel runtime %23 hızlanma → %1 toplam eğitim süresi azalması 2025-05 deploy
FlashAttention GPU kernel Low-level talimat seti %32,5 hızlanma 2025
TPU Verilog (matrix mul unit) Devre bit-width Bit kaldırma — formal verification geçti, yaklaşan TPU'ya entegre 2025
Spanner LSM-tree compaction Write amplification %20 azalma 2026-05 update
Cache replacement policy Keşif süresi Aylar → 2 gün 2026-05 update
Compiler optimizations Yazılım storage footprint ~%9 azalma 2026-05 update

3. %0,7, %23, %32,5: Üretim Metriklerine Yalın Bakış

%0,7 kapasite geri kazanımı küçük gibi görünür — ama bu Google'ın küresel compute footprint'inden bahsediyoruz. AlphaEvolve, Borg orkestratörü için bir scheduling heuristic'i keşfetti; bu heuristic, bir kez deploy edildikten sonra arka planda sürekli çalışıyor: aday scheduling policy modifikasyonları üretip historical workload trace'lerine karşı simülasyonda değerlendiriyor, yüksek-fitness adayları gölge prodüksiyona (gerçek job'ları kontrol etmeden, paralel) alıyor, sonra tam terfi ediyor. %0,7 rakamı bu sürekli loop'un steady-state çıktısı.

%23 Gemini kernel hızlanması daha çarpıcı çünkü şunu ifade ediyor: AI, doğrudan AI'ın eğitilme sürecini hızlandırıyor. Söz konusu kernel, bir training run sırasında milyarlarca kez çalışan matrix multiplication ve attention computation operasyonlarını içeriyor. AlphaEvolve öncesinde Google mühendisleri bu kernel'ı manuel profiling, XLA optimizasyon geçişleri ve elle yazılmış CUDA/TPU implementasyonlarıyla yıllarca optimize etmişti — ve "near-optimal" kabul ediliyordu.

Modern bir veri merkezinde sunucu rafları
Google Borg veri merkezi orkestrasyon katmanı — AlphaEvolve'un keşfettiği scheduling heuristic, bir yıldan uzun süredir kesintisiz çalışıyor. Borg'un orijinal heuristic'i yıllar süren manuel ayar gerektirmişti.

AlphaEvolve, bu near-optimal noktada %23'lük bir iyileştirme buldu. Mekanizma: loop reordering, memory access pattern restructuring ve insan mühendislerin TPU ölçeğindeki cache davranışı sezgilerine ters görünen yeni tiling stratejileri. Evrimsel arama, teorik operasyon sayımı bakımından verimsiz görünen binlerce karşı-sezgisel implementasyonu test etmeye razıydı — ve içlerinden biri gerçek donanımda anlamlı şekilde daha hızlı çıktı.

%32,5 FlashAttention hızlanması low-level GPU talimat optimizasyonunda gerçekleşti. Bu domain genellikle compiler'lar tarafından zaten ağır şekilde optimize edildiği için insan mühendisler buraya çok az dokunur. AlphaEvolve, compiler'ların ulaşamadığı bir performans katmanı bulduğunu kanıtladı.

4. TPU Verilog'a İlk AI Katkısı: Donanımı Yazılım Yazıyor

Bu, retrospektifin en sembolik anı. AlphaEvolve, bir TPU'nun matrix multiplication unit'inin çoktan optimize edilmiş Verilog implementasyonunu daha da iyileştirmek için göreve verildi. Optimizasyon hedefleri: alan ve güç tüketimini azalt, çekirdek fonksiyonelliği koru. Sonuç hem alan hem güç kazandıran bir bit-width azaltma önerisi oldu — ve formal verification metoduyla doğrulandı, TPU tasarımcılarının manuel inceleme onayını aldı.

Önemli detay: bu spesifik iyileştirmeyi downstream synthesis tool'ları da bağımsız bulmuştu. AlphaEvolve'un katkısı RTL aşamasındaydı — yani zincirin başında, daha az otomatize edilmiş yerde. Üstelik öneri doğrudan Verilog dilinde, donanım mühendislerinin standart dilinde verildiği için adoption hızlı oldu. Trust ve interpretability açısından bu kritik — kara kutu değil, okunabilir RTL.

Geliştirici workstation ve kod ekranı
AlphaEvolve'un Verilog ve Pallas çıktıları — donanım/yazılım sınırını mühendisin okuyabileceği biçimde geçiyor. Output kara kutu değil; standart endüstri dilinde.

DeepMind blog yazısının tam ifadesi şu: "Bu iyileştirme yaklaşan bir TPU'ya entegre edildi ve Gemini'nin TPU aritmetik devrelerine yaptığı ilk doğrudan katkıyı temsil ediyor — gelecek katkıların önünü açıyor." Yani tek seferlik bir gösteri değil; sistematik bir uygulama hattının başlangıcı.

5. Spanner LSM-tree, Cache Policy ve Compiler: Stack'in Her Katmanı

7 Mayıs 2026 retrospektif update'i hikâyeye üç yeni katman ekledi. Spanner, Google'ın global ölçekli relational veritabanı; LSM-tree (Log-Structured Merge-tree) compaction heuristic'leri write amplification (yazılan veri / orijinal istek oranı) belirler. AlphaEvolve, bu heuristic'i yenileyerek %20 write amplification azalması sağladı. Pratik anlamı: aynı yük altında daha az disk yazımı, dolayısıyla daha az SSD aşınması ve daha düşük IO maliyeti. Petabyte ölçeğinde sayılar ciddileşiyor.

Cache replacement policy hikayesi farklı bir boyutu vurguluyor — keşif hızı. Daha önce bu tarz bir optimizasyonu bulmak "aylar süren konsantre, insan-yoğun bir çaba" gerektiriyordu. AlphaEvolve aynı işi 2 günde tamamladı. Önemli olan tek bir "akıllı" cevap üretmek değil; binlerce aday üzerinde paralel evrim yapıp gerçek workload'larda en iyiyi seçebilmek. İnsan mühendislerin arama uzayını manuel tarama hızına karşı asimptotik bir avantaj.

Compiler optimizations tarafında AlphaEvolve, yeni derleyici stratejileri için içgörüler sundu — bunlar yazılım depolama ayak izinde ~%9 azalmaya yol açtı. Compiler dünyası onlarca yıllık manuel mühendislik birikimi içerir; %9 burada saygın bir delta.

6. 56 Yıl Sonra Strassen Rekoru: 4×4 Matris 48 Skaler Çarpma

Pratik altyapı kazanımlarının yanında AlphaEvolve, bilim tarihine yazılacak bir matematik sonucu da üretti. Strassen'in 1969 algoritması, iki 4×4 matrisin çarpımını 49 skaler çarpma ile yapıyordu — ve karakteristik 0 veya kompleks sayılı alanlarda bunun altına kimse inememişti. 56 yıllık açık problem.

AlphaEvolve, 4×4 kompleks değerli matrisleri 48 skaler çarpma ile çarpan bir prosedür buldu. Bu, sadece bir sayı değil; matematiksel optimizasyonun klasik bir kalesinin makineleşmiş arama tarafından kırılması. Aynı çalışma içinde 14 farklı matris çarpım hedefinde state-of-the-art geliştirildi.

Tahta üzerinde matematik formülleri
Strassen 1969'dan beri 4×4 matris çarpımının taban sınırı 49 skaler çarpmaydı. AlphaEvolve 56 yıl sonra bu sınırı 48'e indirdi — kompleks alanda. Klasik bir matematik kalesinin makineleşmiş arama tarafından kırılması.

Matematik değerlendirmesi paper'da daha geniş kapsamla ele alındı. AlphaEvolve, 50'den fazla açık matematik probleminde test edildi — analiz, kombinatorik, geometri, sayı teorisi dallarında. Bu örneklemde:

  • %75: en iyi bilinen yapıyı tekrar buldu (çoğu durumda zaten optimal)
  • %20: önceki state-of-the-art'ı geçen yeni nesneler keşfetti
  • Erdős'un Minimum Overlap probleminde iyileştirme
  • 11 boyutta Kissing Numbers probleminde yeni alt sınır
Problem Önceki SOTA AlphaEvolve sonucu Kanıt
4×4 kompleks matris çarpım rank 49 (Strassen 1969) 48 arXiv 2506.13131, Tablo 2
14 farklı matris mul boyut Karışık SOTA 14/14'ünde gelişme Aynı paper
Erdős Minimum Overlap Erdős 1955 sınırı İyileştirildi Aynı paper
Kissing Numbers (11D) Önceki SOTA alt sınır Yeni alt sınır Aynı paper
Hexagon packing (n=11,12,15,16) AlphaEvolve V1 ImprovEvolve yeni SOTA (2026-02) arXiv 2602.10233
İkinci autocorrelation eşitsizliği 0,96102 (AlphaEvolve) 0,96258 (ImprovEvolve human-edited) arXiv 2602.10233

7. AlphaProof + Deep Think: 67 Matematik Problemi ve Topluluk Etkisi

Kasım 2025'te yayımlanan ikinci paper (arXiv 2511.02864, Aralık 2025'te v3'e güncellendi) AlphaEvolve'un matematik kapsamını 67 probleme genişletti. Paper'ın asıl yeniliği AlphaEvolve'u Deep Think ve AlphaProof ile birleştirip arama-üretme döngüsüne otomatik ispat üretimi ve daha geniş matematiksel reasoning eklemesi. Bazı durumlarda sonuçlar yalnızca tek tek problemler için değil, tüm girdi değerleri için geçerli kapalı formüllere genelleniyor.

"AlphaEvolve, kodda doğrudan değişiklikler yaparak bir algoritmayı iyileştirme görevi verilen bağımsız bir LLM pipeline'ını orkestra eder. Evrimsel bir yaklaşımla, bir veya birden fazla evaluator'dan sürekli geri bildirim alarak algoritmayı iteratif olarak iyileştirir, potansiyel olarak yeni bilimsel ve pratik keşiflere yol açar."

Soyut nöral ağ görseli
Gemini 2.0 Flash + Gemini 2.0 Pro çift-model ensemble — AlphaEvolve'un mutation operatörü çekirdeği. Flash genişlik, Pro derinlik; cascaded evaluation ile maliyet kontrol altında.

Topluluk tarafında etki hızlı yayıldı. OpenEvolve, AlphaEvolve'un açık kaynak topluluk implementasyonu olarak ortaya çıktı. ImprovEvolve (arXiv 2602.10233, Şubat 2026) AlphaEvolve'un ürettiği programları yeniden parametrize ederek hexagon packing'de 11, 12, 15 ve 16 hexagon için yeni SOTA — insan-edited varyantla 14, 17 ve 23 için ek gelişme — elde etti. DeepEvolve (arXiv 2510.06056, Ekim 2025) ise AlphaEvolve'un evrimsel motorunu Deep Research ile birleştiriyor; 9 benchmark'ta (kimya, matematik, biyoloji, malzeme, patent) sürekli iyileşme gösterdi. DOE National Laboratories, AlphaEvolve hızlandırılmış erişim programının parçası oldu — AI ile bilimsel altyapı arasındaki köprü genişliyor. Google Cloud Mayıs 2026'da AlphaEvolve'u commercial enterprise rollout'a aldı; çok-sektörlü erişim açıldı.

8. Sınırlamalar: ~100 Compute-Saat ve Otomatik Evaluator Şartı

Hype'tan ayıralım: AlphaEvolve her problemi çözmüyor. Sistem yalnızca otomatik evaluator'ın tanımlanabildiği problemlerde çalışıyor — yani kazanma/kaybetme ölçütü makineleşmiş bir fonksiyonla ifade edilebilen alanlar. Wet-lab deneyleri gerektiren biyolojik araştırma, A/B test gerektiren ürün özellikleri, veya insan değerlendirme döngüsü zorunlu yaratıcı işler kapsam dışı.

İkinci sınır: ~100 compute-saat / yeni çözüm değerlendirmesi ciddi bir maliyet. Hyperscaler ölçeğinde paralelizasyon doğaldır, ama küçük bir takım için aynı yaklaşımı çekmek pahalı kalır. Cascaded evaluation, Flash-first stratejisi, evaluation caching ve early stopping gibi optimizasyonlarla maliyet azaltılabilir.

Üçüncüsü, dürüst aktarım: paper'daki sayılar büyük oranda vendor-reported. Donanım yapılandırmaları (TPU jenerasyonu, GPU model), measurement methodology (kaç run, warm-up, varyans), median/mean ayrımı kamuya açıklanmadı. Verifiable olan tek alan matematiksel sonuçlar — onlar paper'ın ek deposundaki Colab not defterinde test edilebiliyor. Üretim metriklerinin "iç şirket ölçümü" rejiminde değerlendirilmesi gerek.

Dördüncüsü, kopyalamanın anahtarı: AlphaEvolve şablonuna kendi sisteminizde sahip olmak istiyorsanız, ilk kazıyı otomatik evaluator altyapınıza yapmanız gerekir. Modeller hızla taklit edilir; evaluator'ı tasarlamak yıllarca süren mühendislik.

9. Bir Mühendisin Bakışı: Ne Değişti, Ne Değişmedi

1 yıl sonra dürüst değerlendirme şu: self-improving production AI gerçek, ama AGI ya da "her şeyi çözen makine" söylemleri yine yanlış. AlphaEvolve, daraltılmış optimizasyon problemlerinde ölçülebilir, kalıcı kazanımlar üretebilen bir sistem. Etkisi büyük çünkü hyperscaler ölçeğinde küçük yüzdeler büyük dolar; ama küçük takımlar için doğrudan transfer edilebilir bir araç değil — replikasyonun maliyeti yüksek.

Ne değişti: artık "AI optimizasyon işine yarıyor mu?" sorusunun yerini "otomatik evaluation altyapınız ne kadar olgun?" sorusu aldı. Bir codebase üzerinde evrimsel arama yürütmek isteyen herkes önce evaluator tasarımını çözmek zorunda. Bu, geleneksel mühendislik için yeni bir disiplin değil — testler, benchmark'lar, profiling — sadece artık insan-değil bir aktör tarafından sıkı kullanılıyor.

Ne değişmedi: yorum, yargı ve mimari karar hâlâ insan işi. AlphaEvolve okunabilir Verilog ve Pallas üretiyor — ama bu kodun "doğru problemi" çözüp çözmediğine TPU tasarımcısı karar veriyor. Trust katmanı insan onayında kalıyor. Mühendislik kariyer trajektorisi aynı kalıyor; sadece tool stack daha güçlü.

Pratik takeaway: bir sonraki büyük bottleneck'inizi belirleyin — kernel runtime, scheduling, indeks compaction, derleme süresi, ne ise — ve sorun: "Bunun bir otomatik evaluator'ı yazılabilir mi?" Cevap evetse, evrimsel kod arama döngüsünü kurmak artık hayali değil; OpenEvolve gibi açık alternatifler de mevcut. Cevap hayırsa, gerçek iş evaluator'ı tanımlamakta — model değil. Modeller hızla taklit edilir; evaluator'ı tasarlayan mühendislik onlarca yıl önündedir.

Yorumlar (0)

Yorum ve puan bırakın

Henüz yorum yapılmamış. İlk yorumu sen bırak.