DeepSeek V4 Flash: فشل وكيل وارتفاع أسعار يصل إلى 1100%

أكمل نموذج DeepSeek V4 Flash، الذي تصدر لوحات المتصدرين ووصفه المطورون بأنه "وحش مطلق"، 53.8% فقط من مجموعة مهام الوكلاء المعقدة في اختبارات واقعية. هذا الأداء، الذي يتناقض…
مقدمة تحليلية
أكمل نموذج DeepSeek V4 Flash، الذي تصدر لوحات المتصدرين ووصفه المطورون بأنه "وحش مطلق"، 53.8% فقط من مجموعة مهام الوكلاء المعقدة في اختبارات واقعية. هذا الأداء، الذي يتناقض بشكل حاد مع مكانته المعلنة، يأتي متزامناً مع إعلان DeepSeek عن زيادة في الأسعار تصل إلى 1100% لنموذجي V4 Flash و V4 Pro. طرحت DeepSeek نسخة V4 Flash التجريبية العامة في 31 يوليو، وأتبعتها بنموذج V4 Pro متاحاً بشكل عام في 13 أغسطس. تبرز الفجوة بين قدرات النموذج الخام ونتائج العالم الحقيقي الدور الحاسم للتنسيق (orchestration)، وليس فقط قدرة النموذج الأساسية، في تحديد مدى نجاحه ضمن بيئات الشركات اليومية، خاصةً مع تحول عامل التكلفة الاقتصادي بشكل جذري.
التحليل التقني
أخضعت شركة Composio نموذج DeepSeek V4 Flash لاختبارات صارمة على ثمانية أنظمة وكلاء مختلفة، منها Claude Code و Codex و OpenCode. شملت الاختبارات 30 مهمة صعبة ومتعددة الخطوات، امتدت عبر أدوات حية مثل Gmail و GitHub و Slack و Google Sheets. من أصل 240 عملية تشغيل إجمالية، نجح 129 فقط، ولم تكتمل سوى ستة من أصل 30 سير عمل بنجاح بواسطة كل نظام وكيل تم اختباره. يشير هذا التفاوت إلى أن أداء النموذج يختلف بشكل كبير بناءً على النظام الذي يعمل عليه، وتكوين الأداة، وسلوك التخزين المؤقت، ومحاولات الاسترداد، ومكدس الموفر (provider stack).
يمتلك DeepSeek V4 Flash، ذو الـ 284 مليار معلمة، تصميماً موجهاً للحجم والسرعة، بينما نموذج DeepSeek V4 Pro، الأكبر بـ 1.6 تريليون معلمة، مصمم لسير العمل الأكثر تعقيداً. يتميز كلا النموذجين بقدرات استدلال مرنة (منخفضة، عالية، قصوى) وأنماط تفكير تطبق استدلال "سلسلة الأفكار" (CoT) لتحسين دقة الإجابات. وقد أشاد باحث التعلم الآلي ناثان لامبرت بـ V4 Flash، مشيراً إلى أن "أرقام التبني الأولية لـ DeepSeek V4 Flash كانت جنونية"، مضيفاً أنه "سجل نفس أداء GLM 5.2"، مما يجعله "وحشاً مطلقاً". وقد سيطر النموذج بالفعل على لوحة صدارة الاستخدام في OpenRouter، ليصبح الأكثر استخداماً من حيث حجم الرمز الأسبوعي.
هيكلة التسعير الجديدة
أعلنت DeepSeek عن رفع أسعار واجهة برمجة تطبيقات V4، بزيادات تصل إلى 1,100% اعتماداً على النموذج ونوع الرمز وزمن الاستخدام. الهيكلة الجديدة كالتالي:
- Flash: 22 سنتًا لكل مليون رمز إدخال و 66 سنتًا لكل مليون رمز إخراج خارج أوقات الذروة؛ و 44 سنتًا لكل مليون رمز إدخال و 1.32 دولار لكل مليون رمز إخراج في أوقات الذروة. تمثل هذه زيادة تتراوح بين 57% و 371%.
- Pro: 66 سنتًا لكل مليون رمز إدخال و 1.98 دولار لكل مليون رمز إخراج خارج أوقات الذروة؛ و 1.32 دولار لكل مليون رمز إدخال و 3.96 دولار لكل مليون رمز إخراج في أوقات الذروة. تُظهر هذه قفزة تتراوح بين 51% و 355%.
- Cache hits: ارتفعت بين 52% و 1,100%.
تهدف DeepSeek من خلال تقديم 50% خصماً على الاستخدام خارج أوقات الذروة (17 ساعة من كل 24 ساعة بسعر النصف) إلى تشجيع "جدولة عبء العمل الأكثر مرونة". المفارقة أن الهيكل الجديد يسعّر السوق المحلي للشركة بأعلى الأسعار.
السياق وتأثير السوق
تثير الزيادة الحادة في أسعار DeepSeek تساؤلات حول جاذبية النموذج الأساسية، التي كانت تعتمد على تقديم قدرات نموذجية فائقة بأسعار منخفضة جداً لا يمكن لمقدمي الخدمات الرواد (frontier providers) مجاراتها. يصف محلل التكنولوجيا كارمي ليفي هذه الخطوة بأنها "خطوة انتحارية" لمنصة لا تزال تسعى للحصول على المصداقية ضد بائعي نماذج الذكاء الاصطناعي الأكثر رسوخاً. من المؤكد أن هذه الزيادات ستؤثر على ميزة DeepSeek السعرية، وتجبر العملاء على الموازنة بشكل أكبر بين الأداء والتكلفة وبين المخاوف المتعلقة بأصول الشركة الصينية.
ومع ذلك، يؤكد ليفي أن DeepSeek لا يزال "أرخص بكثير" بجميع مقاييس التسعير مقارنة بالنماذج المنافسة من OpenAI و Anthropic و Google و Cohere و xAI وغيرها. وبالتالي، ورغم أن هذه الخطوة ستجبر DeepSeek على التركيز على الأداء والأمان بدلاً من التكلفة، فإنها لا تقضي على ميزتها الملحوظة بالفعل في نسبة السعر إلى الأداء، ولا تزال تمنح العملاء مجالاً واسعاً لتبرير استخدامه لأعباء عمل محددة. قال سانشيت فير جوجيا من Greyhound Research إن هذه "ليست مجرد زيادة بسيطة في الأسعار"، بل "هندسة تسعير تجعل توقيت الاستدلال متغيراً اقتصادياً". يتوقع جوجيا أن الأعمال التي يمكن أن تنتظر، مثل التقييمات الدفعية وتوليد البيانات الاصطناعية، ستنتقل إلى الساعات الأرخص، بينما تظل الوكلاء التفاعليون والعمليات الحية في الساعات الأكثر تكلفة.
لا تزال عملية التبني داخل الشركات محفوفة بالتساؤلات بسبب عوامل مثل التكلفة والقدرة والموثوقية وحوكمة البيانات والأمن. يشير ليفي إلى أن أحد حالات الاستخدام المحتملة هو المعالجة الدفعية (batch processing)، حيث تكون المهام روتينية ومتكررة ولا تتطلب ذكاءً رفيع المستوى، مما يجعل استخدام نموذج أرخص وأكثر كفاءة منطقياً. وتوقع ليفي تبنياً جزئياً، يتضمن أعباء عمل معزولة وغير حساسة ذات مقاييس نجاح محددة بوضوح وإشراف صارم، ونماذج احتياطية في حال الفشل. في هذا السياق، أوضح مهندس البرمجيات في Meta، نامان أهوجا، أن الوكلاء الأكثر فائدة في المؤسسات غالبًا ما ينسقون سير العمل المتكررة عبر أنظمة متعددة، مع أذونات محددة، وقابلية للتدقيق، ومراقبة، وموافقة بشرية للإجراءات ذات المخاطر العالية.
رؤية Glitch4Techs
DeepSeek V4 Flash، رغم تصدره لوحات المتصدرين ووصفه بالـ "وحش المطلق" من قبل المطورين، يظل نموذجاً غير ناضج بشكل أساسي للنشر وكيلياً في بيئات المؤسسات. نسبة نجاحه البالغة 53.8% في مهام الوكلاء الحقيقية، كما أظهرت اختبارات Composio المكثفة، تتعارض مباشرة مع قدراته النظرية، وتؤكد أن القدرة الخام للنموذج غير كافية دون تنسيق قوي وموثوقية مثبتة. حتى إرشادات دمج DeepSeek نفسها تعترف بهذه الفجوة، حيث تشير إلى أن إدخالات V4 المدمجة "غير كافية للتشغيل الموثوق به دون تجاوزات التوافق". إن رفع الأسعار بنسب تصل إلى 1,100% لا يؤدي إلا إلى تفاقم هذه المشكلة، محولاً النموذج إلى تجربة مكلفة وغير موثوقة لسير العمل الحرج، ويجعله عرضاً ضعيفاً للشركات التي تبحث عن استقرار وأداء يمكن الاعتماد عليه.
كن أول من يعرف بمستقبل التقنية
أهم الأخبار والتحليلات التقنية مباشرة في بريدك.



