طوال عام 2025، واجهت المشكلة ذاتها مرارًا: المحرك الرئيسي للتكاليف في أي منتج يعتمد على الذكاء الاصطناعي لم يكن اختيار النموذج ولا تصميم البنية، بل تكاليف الاستدلال. كل استدعاء لواجهة برمجية يكلّف مالًا، وحين تبني وكيلًا متعدد الخطوات فإن تلك التكاليف تتراكم بسرعة لافتة.
في مؤتمر GTC 2026 الذي انعقد في مارس، أعلنت NVIDIA عن منصة Vera Rubin، وثمة رقم واحد استوقفني طويلًا: تكاليف رمز الاستدلال تنخفض 10 أضعاف مقارنة بـ Blackwell، وهو فارق يبدو كبيرًا بما يكفي ليغيّر طريقة تفكير الفرق الهندسية في تصميم منتجاتها لعام كامل قادم.
- 50 بيتافلوبس FP4، مقابل 20 بيتافلوبس لـ Blackwell (زيادة خام 2.5x)
- أرخص بـ 10 أضعاف في تكلفة رمز الاستدلال مقارنة بـ Blackwell
- وحدات GPU أقل بـ 4 أضعاف لنفس عبء العمل التدريبي
- TSMC 3nm، مع ذاكرة HBM4
- 88 مليار دولار: مبيعات الرقائق العالمية في فبراير 2026 وحده (+62% سنويًا)
- 500 مليار دولار: هدف مبيعات GPU لـ NVIDIA في نهاية 2026
- Rubin Ultra (2027): 100 بيتافلوبس، مع جيل تالٍ معلن بالفعل
ما هو Vera Rubin وماذا غيّر؟
هذا أكبر تحول معماري منذ Blackwell، إذ لم تعد NVIDIA تصمم وحدات GPU وحدها. صُمّم Vera CPU وRubin GPU معًا كمنصة واحدة. لماذا هذا الأمر مهم إلى هذا الحد؟
تعمل الوكلاء مع نماذج اللغة الكبيرة ومع نوافذ السياق الواسعة. يستقبل الوكيل مهمةً، ثم يتحقق من الذاكرة، ثم يستدعي أداةً، ثم يعالج النتيجة، ثم يحدد الخطوة التالية. طوال هذه الدورة المتكررة يتبادل المعالج المركزي ووحدة GPU البيانات باستمرار، وقد كان هذا التبادل في الجيل السابق هو عنق الزجاجة الحقيقي، إذ كان عرض نطاق PCIe وزمن الاستجابة وعمليات نسخ البيانات تستهلك جزءًا معتبرًا من ميزانية الأداء. ويبدو أن Vera Rubin يزيل هذا الاختناق عبر تصميم كلا العنصرين تحت معمارية واحدة منذ البداية.
أما Rubin CPX فهو فئة منفصلة بالكامل: فئة GPU جديدة مُحسَّنة خصيصًا للاستدلال بسياق واسع، إذ يمكنها معالجة نافذة بمليون رمز بتكلفة منخفضة. أي أن «سياق بمليون رمز» و«تشغيل هذا السياق اقتصاديًا» أصبحا ممكنين معًا الآن، وهي حالة لم تكن مطروحة بجدية قبل عام واحد فقط.
المقارنة مع Blackwell
| الميزة | Blackwell (GB200) | Vera Rubin | التغيير |
|---|---|---|---|
| الحوسبة الخام (FP4) | 20 بيتافلوبس | 50 بيتافلوبس | +150% |
| تكلفة رمز الاستدلال | القاعدة | القاعدة / 10 | أرخص بـ 10x |
| وحدات GPU للتدريب | القاعدة | القاعدة / 4 | أقل بـ 4x |
| الذاكرة | HBM3e | HBM4 | نطاق ترددي أعلى |
| تقنية التصنيع | TSMC 4nm | TSMC 3nm | أكثر كفاءة |
| تكامل المعالج المركزي | Grace (تصميم منفصل) | Vera (تصميم مشترك) | تكامل معماري |
| استدلال السياق الواسع | GPU قياسي | Rubin CPX (فئة مخصصة) | مُحسَّن |
ماذا يعني انخفاض تكاليف الاستدلال بـ 10 أضعاف للمطورين؟
لنأخذ مثالًا واقعيًا. لنفترض أن وكيلك يُشغّل حلقة استدلال بألف رمز لكل دورة، وعلى البنية التحتية القائمة على Blackwell تكلفة ذلك تساوي X. على Vera Rubin، يكلّف عبء العمل ذاته X مقسومًا على عشرة، وهو فارق رقمي بسيط في ظاهره، غير أنّه ينعكس على قرارات هندسية كبرى.
قد يكون من الخطأ النظر إلى الأمر بوصفه مجرد توفير في التكاليف، إذ إنه يغيّر قرارات المنتج ذاتها:
- استدعاءات أكثر تكرارًا: «تشغيل النموذج عند كل نقرة مستخدم» يصبح مجديًا اقتصاديًا دون ترشيد دقيق لكل استدعاء.
- نوافذ سياق أطول: نافذة بمليون رمز لكل استعلام كانت رفاهية بسعر أعلى بـ 10 أضعاف، أما اليوم فقد أصبحت خيارًا تصميميًا اعتياديًا.
- خطوات وكيل أكثر: سلاسل التفكير متعددة الخطوات تبدو مختلفة تمامًا حين تنخفض تكلفة كل خطوة بـ 10 أضعاف، فخطوات أكثر تعني مخرجات أذكى، وبالتالي منتجًا أفضل.
- عتبة أدنى للشركات الناشئة: ميزانية الاستدلال التي أعاقت الفرق الصغيرة طوال عام 2025 تنخفض بصورة ملحوظة.
البعد الجيوسياسي: سباق الصين
قال أحد المحللين في تقرير للأسواق إن «من يملك السيليكون يملك مستقبل الذكاء الاصطناعي»، وهي عبارة تبدو مبالغة لولا أرقام السوق نفسها. في عام 2025، استحوذ المصنعون الصينيون على %41 من سوق خوادم مسرعات الذكاء الاصطناعي. ويسد Huawei Ascend 910C جزءًا من الفجوة التي تركتها قيود تصدير NVIDIA، وفي كل مرة تُشدَّد فيها ضوابط التصدير الأمريكية، يصبح النظام البيئي الصيني أكثر استقلالية وأقل اعتمادًا على الواردات.
أرى أن هذه الديناميكية تشكّل قيدًا ودافعًا في الوقت ذاته بالنسبة لـ NVIDIA. فالإطلاق المتسارع لـ Vera Rubin والإعلان المبكر عن Rubin Ultra لعام 2027 ليسا قرارًا تجاريًا بحتًا، إذ إنهما جزئيًا استجابة لهذا السباق المحتدم، حيث تتحرك المنصة بسرعة لأن التوقف ليس خيارًا مطروحًا. أما المطورون فيواجهون واقعًا جديدًا: خيارات البنية التحتية لم تعد قرارًا تقنيًا صرفًا، بعد أن تشابكت مع سلاسل التوريد ومع الحسابات الجيوسياسية في آنٍ واحد.
الأولويات العملية لعام 2026
- قِس تكاليف استدلالك الحالية: ماذا تنفق فعلًا؟ بدون هذا الرقم لا يمكنك حساب تأثير Vera Rubin على عملك.
- أعد تقييم حالات استخدام نافذة السياق الكبيرة: ما السيناريوهات التي رفضتها لأن نافذة مليون رمز كانت مكلفة جدًا؟ عند انخفاض التكلفة بـ 10 أضعاف، يمكن إعادة فتح تلك القرارات.
- راجع عدد خطوات وكيلك: هل قللت خطوات التفكير لإدارة التكاليف؟ هذا القيد تقلص بصورة ملحوظة الآن.
- راقب النصف الثاني من 2026 عن كثب: منتجات Vera Rubin تدخل السوق حينها. أي مزود سحابي يحصل على الوصول أولًا؟ تابع أسعار AWS و GCP و Azure.
- ضع Rubin Ultra (2027) ضمن تخطيطك بعيد المدى: 100 بيتافلوبس وانخفاض محتمل آخر في التكاليف. وافق خارطة طريق منتجك مع هذه الوتيرة.
خلاصة
انخفاض تكاليف الاستدلال بمقدار 10 أضعاف يُعيد رسم حدود ما يمكن تحقيقه بالذكاء الاصطناعي، ليس بوصفه ادعاءً تسويقيًا، بل واقعَ بنية تحتية إنتاجية يمكن قياسه بأرقام محددة. والقدرة على السؤال «كيف أصمم هذا جيدًا؟» بدلًا من «هل يمكنني تحمل تكلفة هذا أصلًا؟» تُمثل نقطة بداية مختلفة فعلًا للمحادثات الهندسية اليومية داخل الفرق.
لعلّ من أمضى معظم عام 2025 في إدارة ميزانيات الاستدلال يجد أن النصف الثاني من 2026 سيبدو مختلفًا، ويستحق التفكير في ذلك الآن قبل أن يتحول الفارق إلى ميزة تنافسية في يد المنافسين.
التعليقات (0)
لا توجد تعليقات بعد. كن أول من يعلق.