Nvidia Tesla V100: 32GB VRAM بـ 266 دولاراً لتشغيل LLM
فريق جلتشمنذ 10 ساعات0 مشاهدة5 دقائق

مهووس بالحوسبة يدمج Nvidia Tesla V100 مُعاد تدويرها مع RTX 4080، ليضاعف ذاكرة VRAM إلى 32GB بتكلفة 266 دولاراً، مشغلاً نموذج LLM بـ 27 مليار بارامتر بسرعة 32 رمزاً في الثانية.
مقدمة تحليلية
بتكلفة 266 دولاراً أمريكياً فقط، تمكن المهووس بالحوسبة أوسكار مولنار من مضاعفة إجمالي ذاكرة VRAM لنظامه إلى 32GB، محققاً أداءً لافتاً في تشغيل النماذج اللغوية الكبيرة (LLMs) محلياً. ففي 26 يوليو 2026، أظهر مولنار كيف يمكن لبطاقة Nvidia Tesla V100 SXM2 المؤسسية، التي تعتبر قديمة نسبياً وذات ضوضاء عالية، أن توفر قدرة حاسوبية هائلة بتكلفة زهيدة لمشاريع الذكاء الاصطناعي الشخصية. هذا النظام المعدّل، الذي يجمع بين بطاقة استهلاكية وبطاقة خوادم سابقة، قادر على تشغيل نموذج LLM بـ 27 مليار بارامتر بسرعة 32 رمزاً في الثانية. هذا الأداء، الذي وصفه مولنار بأنه "سريع بما يكفي للاستخدام التفاعلي" و"أسرع من معظم بدائل API السحابية"، يقدم حلاً مباشراً لتكاليف الحوسبة المتزايدة. يكتسب هذا المشروع أهمية خاصة في ظل ما يُعرف بـ "RAMpocalypse" الذي يرفع أسعار مكونات الذاكرة، مما يجعل حل مولنار الاقتصادي نقطة جذب رئيسية للمتحمسين والمطورين الذين يسعون للحصول على قدرات معالجة LLM محلية دون إنفاق مبالغ باهظة على أحدث الأجهزة.التحليل التقني
العمود الفقري لهذا النظام المبتكر هو بطاقة Nvidia Tesla V100 SXM2، وهي وحدة معالجة رسوميات مؤسسية تم الحصول عليها بسعر يقل عن 140 دولاراً أمريكياً عبر eBay، لا سيما عند الشراء من الصين. هذه البطاقة، رغم عمرها، تتميز بمواصفات قوية لأغراض الاستدلال للنماذج اللغوية الكبيرة:- ذاكرة VRAM: 16GB HBM2 عالية النطاق الترددي
- المعمارية: Volta
تكامل الأجهزة والتحكم الحراري
بإضافة هذه البطاقة إلى بطاقة الرسوميات الموجودة لديه، Nvidia RTX 4080، التي تحتوي على 16GB من ذاكرة VRAM وتعتمد على معمارية Ada، وصل إجمالي ذاكرة VRAM المتاحة للنظام إلى 32GB. هذا المزيج من المعماريات المختلفة (Volta و Ada) يتطلب حلاً برمجياً محدداً للتوافق. كان التحدي التقني الأبرز هو التعامل مع مستويات الضوضاء الهائلة الناتجة عن مروحة التبريد القياسية لبطاقة Tesla V100 SXM2. هذه المروحة كانت تصدر ضوضاء بلغت 82dB، وهي شدة وصفها مولنار بأنها "بين مفرمة النفايات وجزازة العشب". تم التغلب على هذه المشكلة بتعديل بسيط للتحكم في عرض النبضة (PWM)، حيث تم إعادة توجيه أسلاك المروحة لتوصيلها مباشرة برأس مروحة PWM على اللوحة الأم للحاسوب. يمكن استخدام كابل "2.54mm male to PH2.0 female jumper cable" لهذه المهمة كبديل. هذا التعديل يسمح بالتحكم الدقيق في سرعة المروحة، وقد وجد أن تشغيلها بنسبة 10% فقط يكفي لإبقاء درجة حرارة Tesla V100 تحت 50C حتى تحت الحمل الكامل.التوافق البرمجي والأداء
من الناحية البرمجية، استخدم مولنار نظام التشغيل NixOS، مستفيداً من تعريف Nvidia قديم (legacy driver) يوفر دعماً متداخلاً لكلتا المعماريين، Volta و Ada. هذا الإعداد مكن النظام من الاستفادة الكاملة من 32GB VRAM الكلية لتشغيل نماذج LLM. أظهرت الاختبارات أن النظام قادر على معالجة نموذج لغوي كبير بـ 27 مليار بارامتر بمعدل 32 رمزاً في الثانية، وهو أداء وصفه مولنار بأنه "سريع بما يكفي للاستخدام التفاعلي" ويتفوق بشكل واضح على معظم بدائل API السحابية المتاحة حالياً، والتي غالباً ما تكون أكثر تكلفة وأبطأ من حيث الاستجابة.السياق وتأثير السوق
يمثل مشروع أوسكار مولنار تحولاً في كيفية نظر المهوسين إلى استغلال عتاد المؤسسات. ففي سوق تشهد فيه أسعار بطاقات الرسوميات الجديدة، خاصة تلك ذات الذاكرة العالية، ارتفاعاً مستمراً بسبب "RAMpocalypse"، يقدم هذا الحل بديلاً اقتصادياً وفعالاً. بطاقة RTX 4080، وهي بطاقة استهلاكية متطورة، توفر 16GB من ذاكرة VRAM، لكن مضاعفة هذه القدرة إلى 32GB عادة ما يتطلب استثماراً كبيراً في بطاقات مثل RTX 4090 أو بطاقات احترافية أعلى سعراً بكثير. التكلفة الإجمالية لبطاقات Tesla V100s ذات الـ 32GB VRAM الأصلية، على سبيل المثال، ضعف سعر نسخة الـ 16GB التي تم استخدامها في هذا المشروع.تحدي تكاليف السحابة
الأداء المحقق، وهو 32 رمزاً في الثانية لنموذج بـ 27 مليار بارامتر، يضع ضغطاً مباشراً على نماذج استهلاك واجهات API السحابية. فمعظم خدمات API السحابية تتطلب دفعاً مقابل كل رمز تتم معالجته، وقد تعاني من زمن استجابة أطول أو تكاليف متزايدة مع زيادة حجم النموذج وتعقيد الاستعلامات. حل مولنار يوفر قدرة حوسبية محلية، مما يلغي تكاليف التشغيل المتكررة ويضمن خصوصية البيانات. هذا الاتجاه قد يدفع المزيد من المستخدمين إلى استكشاف سوق العتاد المستعمل، خاصة بطاقات المؤسسات القديمة، كطريق للحصول على قدرات LLM محلية بأسعار معقولة. الشركات التي تعتمد على بيع أجهزة جديدة باهظة الثمن أو خدمات سحابية قد تجد نفسها أمام منافسة غير متوقعة من حلول "افعلها بنفسك" التي تعيد تدوير الأجهزة بكفاءة.رؤية Glitch4Techs
مشروع أوسكار مولنار يمثل انتصاراً تقنياً واضحاً للمتحمسين ويثبت أن الاستدلال المحلي للنماذج اللغوية الكبيرة بذاكرة VRAM عالية ممكن بتكلفة زهيدة. إنه دليل قاطع على قيمة إعادة تدوير العتاد المؤسسي الفائض في ظل قيود السوق الحالية. ومع ذلك، فإن هذا الحل، رغم فعاليته، ليس خالياً من العيوب الجوهرية التي تمنع اعتباره نموذجاً قابلاً للتطبيق على نطاق واسع. التحدي الأكبر يكمن في الضوضاء المفرطة لوحدة Tesla V100 SXM2. فبينما تمكن مولنار من تخفيف حدة الضوضاء إلى مستوى مقبول من خلال تعديل PWM الذي يخفض سرعة المروحة إلى 10%، فإن حقيقة أن المروحة القياسية تصدر 82dB من الضوضاء تظل نقطة ضعف حرجة. هذا يتطلب تدخلاً يدوياً وهندسياً لا يناسب المستخدم العادي أو البيئات المكتبية التقليدية، ويحوله من مجرد ترقية إلى مشروع يتطلب خبرة فنية محددة. بالتالي، يبقى هذا الإنجاز مثيراً للإعجاب كبرهان على المفهوم، لكنه ليس حلاً عملياً أو قابلاً للتوسع خارج دائرة المهوسين التقنيين المستعدين لتحمل التعقيدات والضوضاء المصاحبة.النشرة البريدية
كن أول من يعرف بمستقبل التقنية
أهم الأخبار والتحليلات التقنية مباشرة في بريدك.
ملخّص أسبوعي تقرأه في ٥ دقائقبلا إزعاج — إلغاء الاشتراك بنقرة واحدة
مقالات قد تهمك

ذكاء اصطناعي
آدم تايلور يعيد MP944 بالـFPGA في نموذج F-14

ذكاء اصطناعي
مطالبة Hugging Face بمائة مليون دولار من OpenAI بعد اختراق وكيل ذاتي

ذكاء اصطناعي
فصل 3 جيجاوات: حادثة خط كهرباء DC تكشف هشاشة شبكة PJM أمام مراكز بيانات الذكاء الاصطناعي

ذكاء اصطناعي