Gemini 4 Argon: تفوق في 12 معياراً، استثناءٌ في البرمجة

يتصدر Gemini 4 Argon من Google 12 معياراً من أصل 18 ويوفر نافذة إخراج بمليون رمز، لكنه يتراجع في مهام البرمجة ولا يزال غير متاح للجمهور.
مقدمة تحليلية
أعلنت Google عن نموذجها Gemini 4 Argon، محققةً تفوقاً في 12 من أصل 18 معياراً منشوراً ضد GPT-6 Astra وClaude Opus 5.5. النموذج سجل 77.9% في DeepSWE v1.1، و91.7% في فهم الفيديو LVBench، وتصدر LMArena Text Arena بـ 1,525 نقطة. يقدم Argon نافذة إخراج تبلغ مليون رمز، قفزة من 64 ألف رمز، ويبلغ معدل الهلوسة لديه 15% فقط على AA-Omniscience، وهو أقل بـ 3.4x من 51% لـ GPT-6 Astra. كذلك، يقدم سعراً تمهيدياً يعادل خُمس تكلفة GPT-6 Astra.
هذه البيانات تؤكد مكانة النموذج كمتنافس حقيقي في مجالات المنطق، العمل المعرفي، والفهم متعدد الوسائط. لكن التحليل يكشف عن نقطة ضعف محورية: الأداء في مهام البرمجة. في Code Arena WebDev، احتل Argon المرتبة الثامنة بـ 1,679 نقطة، متأخراً بـ 80 نقطة عن GPT-6.1 Sol الذي جاء ثالثاً بـ 1,759 نقطة، ومسجلاً 55.0% في FrontierSWE v2 مقابل 65.5% لـ Astra. هذا التباين يشي باستراتيجية متعمدة من Google، لا مجرد خلل عابر.
التحليل التقني
يعرض Gemini 4 Argon من Google أداءً بارزاً في مجموعة واسعة من المعايير التي تركز على الاستدلال والمعرفة والقدرات متعددة الوسائط:
- في DeepSWE v1.1، سجل Argon نسبة 77.9%، متفوقاً على GPT-6 Astra بـ 74.1% وClaude Opus 5.5 بـ 74.2%.
- في AutomationBench-AA، تجاوز Argon كلا المنافسين بنسبة تزيد عن 35 نقطة مئوية، مسجلاً 77.5% مقارنة بـ 41.4% لـ Astra و42.5% لـ Opus 5.5.
- تصدّر GraphWalks بنسبة 84.2%، متقدماً بـ 12-17 نقطة على 71.8% لـ Astra و66.8% لـ Opus 5.5.
- في LVBench لفهم الفيديو، حقق 91.7%، مما يجعله الأفضل على الإطلاق.
- نافذة الإخراج التي تبلغ مليون رمز تمثل قفزة نوعية من 64 ألف رمز سابقاً، وتتيح معالجة استجابات أطول بـ 15 مرة عبر API "Long Decode Continuation". أمثلة الاستخدام الداخلي تشمل معالجة أكثر من 800 ألف سطر من نواة Fuchsia Zircon واستبدال 32 ألف سطر من كود SIMD في libgav1، مما أدى إلى تحسن السرعة بـ 2.7x.
أداء البرمجة والهلوسة
في المقابل، يتراجع Argon بوضوح في معايير بناء البرمجيات من الصفر. في Code Arena WebDev، جاء في المركز الثامن بـ 1,679 نقطة، متأخراً بـ 80 نقطة عن GPT-6.1 Sol (ثالثاً بـ 1,759). في FrontierSWE v2، سجل 55.0% مقابل 65.5% لـ Astra، بفارق 10.5 نقطة مئوية. وفي Terminal-bench 4.0، حل أخيراً بين النماذج الرائدة بنسبة 57.4%، متخلفاً بـ 9 نقاط عن Claude Opus 5.5 (66.4%).
أما بشأن معدل الهلوسة، فسجل Argon نسبة 15% على AA-Omniscience، مقابل 51% لـ Astra. هذا التحسن الكبير يأتي مع مفاضلة دقيقة: دقة Argon على نفس المعيار هي 50% فقط، مقارنة بـ 63% لـ Astra. النموذج يختار الإجابة بـ "لا أعرف" بشكل متكرر، مما يحسن من مقياس الهلوسة على حساب الدقة الإجمالية. هذه ليست صدفة، بل اختيار هندسي محسوب يفضل الموثوقية على الشمولية في الإجابة، خاصة للتطبيقات المؤسسية.
تحليل Latent Space يؤكد هذه المفاضلة: النموذج ليس أكثر دقة وأقل هلوسة في آن واحد، بل تبادل الدقة بالموثوقية.
السياق وتأثير السوق
إطلاق Gemini 4 Argon يمثل تحدياً مباشراً لمكانة OpenAI وAnthropic، خصوصاً في مجالات محددة. كان معيار Claude Opus 5.5 وGPT-6 Astra هو الأساس في العمليات المعرفية والفهم متعدد الوسائط، لكن Argon يتجاوزهما الآن في 12 معياراً رئيسياً. تعتمد Google استراتيجية تسعير عدوانية؛ بسعره الترويجي، يكلف Argon $2/مليون رمز للإدخال و$10/مليون رمز للإخراج، مع قراءة ذاكرة مؤقتة Cache Read بـ $0.10/مليون رمز. هذا يجعله خُمس سعر Astra ($10/مليون للإدخال، $50/مليون للإخراج) ونصف سعر Opus 5.5 ($4/مليون للإدخال، $20/مليون للإخراج).
كما أن خصم قراءة الذاكرة المؤقتة بنسبة 95% يجعله جذاباً للأحمال التي تتطلب إعادة استخدام سياق مكثف. ولكن، هذا التفوق السعري ليس مرادفاً للكفاءة. يستهلك Argon ما متوسطه 62 ألف رمز إخراج لكل مهمة، مقارنة بـ 27 ألف رمز لـ GPT-6 Astra، أي 2.3x رموز أكثر. هذا يعني أن التكلفة الفعلية للمهمة الواحدة تتغير مع الأسعار العادية: تكلف المهمة $3.98 بـ Argon (بسعر $4/$20)، بينما تكلف $3.26 بـ Astra.
هذا التحليل يقلب الميزة السعرية المبدئية لـ Argon، حيث يصبح Astra أرخص لكل مهمة عند التسعيرة العادية إذا كانت المهمة تتطلب رموز إخراج أقل.
مشكلة التوفر وتوقعات السوق
تُعد مشكلة عدم التوفر العام (GA) لـ Argon نقطة ضعف حرجة. النموذج متاح حالياً فقط من خلال برنامج Google Fairwind لـ "المدافعين السيبرانيين الموثوقين" وعملية الوصول المسبق الحكومية الأمريكية. هذا يعني أن الإطلاق التجاري "للمطورين والشركات والمستهلكين" لم يحدد له تاريخ بعد، مما يمنح Anthropic وOpenAI الوقت الكافي للرد. في أسواق التنبؤ، Polymarket يضع Anthropic بنسبة 74% للحصول على أفضل نموذج ذكاء اصطناعي بنهاية عام 2026، بينما Google بنسبة 9.5% فقط.
هذا يعكس عدم ثقة السوق في السردية القائمة على المعايير وحدها دون توفر عام فعلي.
رؤية Glitch4Techs
Gemini 4 Argon هو بالفعل أقوى نماذج Google حتى الآن، ويفرض نفسه كلاعب أساسي في ساحة النماذج الرائدة. تفوقه في معايير الاستدلال، والعمل المعرفي، والفهم متعدد الوسائط، ومقاومة الهلوسة ليس مجرد تسويق؛ الأرقام حقيقية ومثبتة عبر معايير مستقلة متعددة. لكن هذه الإنجازات لا تحجب حقيقة أن النموذج فشل في معالجة نقطة ضعفه الرئيسية في البرمجة. احتلاله المرتبة الثامنة في Code Arena WebDev، وتخلفه بفارق 10.5 نقطة مئوية في FrontierSWE v2، يؤكد أن Argon ليس الحل الأمثل للمطورين الذين يبنون تطبيقات برمجية من الصفر.
Google راهنت على مجالات أخرى غير البرمجة الخضراء، وهذا واضح من خلال قدرات Argon الفائقة في فهم الكود الحالي وترحيله (كما في Fuchsia Zircon وlibgav1)، لا في بنائه. الحكم لا لبس فيه: Gemini 4 Argon هو محرك ذكاء استثنائي لمهام المعرفة والتحليل متعدد الوسائط، ولكنه ليس أداة مطوري الأكواد الجديدة. ومادام النموذج غير متاح للجمهور، فإن هذه الأرقام، مهما كانت مثيرة للإعجاب، تبقى مجرد وعود تسويقية لا تؤثر في سوق أدوات المطورين الفورية. السوق لا يشتري بنشماركات غير قابلة للاختبار الواقعي.
كن أول من يعرف بمستقبل التقنية
أهم الأخبار والتحليلات التقنية مباشرة في بريدك.



