← GpuPlus Blog

GpuPlus Blog

كم تحتاج نماذج LLM المحلية من VRAM؟ دليل حساب الذاكرة بين 16GB و24GB و32GB

اختر بطاقة لتشغيل نموذج لغوي محلي بعد حساب ذاكرة الأوزان والسياق والطلبات المتزامنة وهامش التشغيل. لا تكفي سعة 16GB أو 24GB أو 32GB وحدها لضمان تشغيل نموذج معين؛ استخدم الحسابات التالية لتحديد الخيارات، ثم تحقق من ذروة الاستهلاك بالإعدادات التي ستستخدمها فعلياً.

1. حدد طبيعة العمل قبل اختيار البطاقة

يتناول هذا الدليل استدلال نماذج اللغة لتوليد النصوص على حاسوب شخصي. والاستدلال هو إنتاج إجابات بواسطة نموذج سبق تدريبه. أما التدريب الكامل والضبط الدقيق وتوليد الصور أو الفيديو فلها متطلبات ذاكرة مختلفة، ولذلك لا تنقل هذه الأرقام إليها مباشرة. ابدأ بتحديد النموذج وظروف تشغيله قبل المقارنة بين أجيال البطاقات أو نتائج الألعاب.

  • دوّن اسم النموذج وإصداره وعدد معاملاته الإجمالي. يشير 8B إلى نحو ثمانية مليارات معامل.
  • حدد صيغة تكميم الملف الذي ستنزله، وتحقق من دعم برنامج التشغيل لها.
  • حدد الحد الأقصى لرموز الإدخال والإخراج وعدد الطلبات المتزامنة.
  • قرر هل يجب إبقاء النموذج كاملاً على البطاقة أم يمكن نقل جزء منه إلى ذاكرة النظام RAM.

تختلف محادثة شخصية تعالج سؤالاً قصيراً واحداً في كل مرة عن أداة تلخص عدة تقارير طويلة معاً، حتى عند استخدام النموذج نفسه. اجعل تحميل النموذج وإكمال أطول طلب حقيقي اختبارين منفصلين للنجاح. احسب الرموز باستخدام أداة الترميز الخاصة بالنموذج، لأن العلاقة بين عدد الأحرف والرموز تختلف بين اللغات.

2. احسب حجم الأوزان ولا تخلطه بذاكرة التشغيل الكاملة

إذا افترضنا تخزين جميع الأوزان بالدقة نفسها، تصبح المعادلة المبسطة: عدد المعاملات × عدد البتات لكل وزن ÷ 8 = عدد البايتات. الأرقام التالية حسابات توضيحية أجراها فريق التحرير، وليست نتائج اختبار فعلي. تعني GB مليار بايت، بينما تعني GiB عدد 1,073,741,824 بايت. وحّد الوحدة قبل مقارنة القياس بالسعة المعروضة للبطاقة.

  • نموذج 8B: أوزان بدقة 16 بت تساوي 16GB، أي نحو 14.90GiB؛ و8 بت تساوي 8GB، أي 7.45GiB؛ و4 بت تساوي 4GB، أي 3.73GiB.
  • نموذج 14B: أوزان بدقة 16 بت تساوي 28GB، أي نحو 26.08GiB؛ و8 بت تساوي 14GB، أي 13.04GiB؛ و4 بت تساوي 7GB، أي 6.52GiB.
  • نموذج 32B: أوزان بدقة 16 بت تساوي 64GB، أي نحو 59.60GiB؛ و8 بت تساوي 32GB، أي 29.80GiB؛ و4 بت تساوي 16GB، أي 14.90GiB.

تحتوي ملفات التكميم الفعلية على معلومات إضافية مثل معاملات القياس، وقد تحتفظ ببعض المصفوفات بدقة أعلى. وتفرق وثائق bitsandbytes بين تكميم 4 و8 بت ونوع البيانات المستخدم للحساب[1]. لذلك لا يعني وصف «4 بت» أن كل العمليات وتخصيصات الذاكرة تستخدم أربعة بتات. حجم التنزيل لا يقيس ذروة ذاكرة التشغيل.

3. اترك مساحة للسياق والطلبات المتزامنة

قسّم الميزانية إلى أوزان محملة وذاكرة KV مؤقتة ومساحة عمل مؤقتة واستخدام الشاشة والبرامج الأخرى وهامش تشغيل. تحتفظ ذاكرة KV بمعلومات وسيطة تُستخدم أثناء توليد الرموز. توضح Hugging Face أنها قد تصبح عائقاً مع السياقات الطويلة، وأن نقلها إلى المعالج المركزي ينطوي على موازنة بين استهلاك الذاكرة والسرعة[2].

لنأخذ مثالاً افتراضياً واضحاً: 9GiB للأوزان، و5GiB للذاكرة المؤقتة ومساحة العمل عند تنفيذ الطلب المستهدف، و1GiB للشاشة والاستخدامات الأخرى. المجموع 15GiB. إذا أضفنا هامشاً توضيحياً قدره 2GiB تصبح الميزانية 17GiB. ضمن هذه الافتراضات، توجد أسباب لاختبار فئة 24GB بدلاً من افتراض كفاية 16GB. ليست أي من هذه القيم، بما فيها الهامش، توصية ثابتة لجميع النماذج.

أعد القياس عند تغيير طول السياق أو عدد الطلبات المتزامنة. لا تفترض أن مضاعفة السياق تضاعف إجمالي VRAM تماماً دون معرفة بنية الذاكرة المؤقتة للنموذج. تحقق أيضاً مما إذا كان البرنامج يحجز مساحة لها مسبقاً. اختبار أطول مستند حقيقي حتى اكتمال طول الإخراج المطلوب يفيد أكثر من الاكتفاء بقياس لحظة التحميل.

4. اربط ميزانية الذاكرة بمنتجات GpuPlus الفعلية

تؤكد المواصفات الرسمية سعة 16GB من نوع GDDR7 لبطاقة MSI RTX 5080 VANGUARD SOC[3]، وسعة 24GB من نوع GDDR6X لبطاقة NVIDIA RTX 4090[4]، وسعة 32GB من نوع GDDR7 لبطاقة GIGABYTE AORUS RTX 5090 MASTER[5]. تمثل المنتجات التالية أمثلة للسعات، وليست ترتيباً لسرعة النماذج اللغوية أو ضماناً لتشغيل نموذج محدد.

  • مثال 16GB — MSI RTX 5080 Vanguard SOC: خيار للدراسة عندما يتسع الاستهلاك الكامل المقاس داخل الذاكرة المتاحة مع هامش كافٍ. السعر المعروض 1,254 USDT، والمخزون 0 وحدات.
  • مثال 24GB — GIGABYTE RTX 4090 Gaming OC: مرشح عندما لا تسمح فئة 16GB بالسياق والهامش المطلوبين. السعر المعروض 2,400 USDT، والمخزون 8 وحدات.
  • مثال 32GB — GIGABYTE AORUS RTX 5090 MASTER: مرشح إذا تجاوزت الميزانية فئة 24GB، لكنه لا يستوعب جميع النماذج الكبيرة. السعر المعروض 3,255 USDT، والمخزون 13 وحدة.

5. قائمة عملية لاختبار يمكن تكراره

اختبر إن أمكن على جهازك الحالي أو بيئة اختبار متاحة، باستخدام النموذج والملف والبرنامج نفسها. تحقق من هذه الشروط أيضاً عند الاستفادة من نتائج نشرها مستخدمون آخرون. اختلاف عدد الرموز في الثانية بين إعدادات مختلفة لا يعزل أثر البطاقة وحدها.

  • احفظ إصدار النموذج واسم الملف وصيغة التكميم وإصداري البرنامج وبرنامج التشغيل معاً.
  • أغلق التطبيقات غير الضرورية التي تستخدم البطاقة، وسجل الاستهلاك قبل التحميل وبعده مباشرة.
  • نفذ أطول إدخال مع الحد الأقصى المطلوب للإخراج وسجل ذروة الذاكرة حتى اكتمال المهمة.
  • إذا احتجت إلى التزامن، كرر الاختبار بعدد الطلبات الحقيقي وسجل أخطاء نفاد الذاكرة إن ظهرت.
  • قيّم زمن أول استجابة وسرعة التوليد وجودة الإجابة كلّاً على حدة؛ الملاءمة داخل الذاكرة ليست معيار النجاح الوحيد.
  • بعد تحديث البرنامج، أعد الاختبار بالإدخال نفسه وافصل القيمة المقاسة عن الهامش الذي اخترته.

6. الخلاصة: حدد السعة ثم تحقق من دعم البرامج

أبقِ فئة 16GB ضمن الخيارات إذا كانت ذروة الاستهلاك مع الهامش تتسع بسهولة في الذاكرة المتاحة. وإلا فادرس 24GB ثم 32GB، مستخدماً وحدة القياس نفسها التي تعرضها الأداة. إذا تجاوزت الحاجة حتى فئة 32GB، ففكر في نموذج أصغر أو إعداد تكميم مختلف أو سياق أقصر أو نقل إلى RAM يدعمه البرنامج صراحة.

تحقق من دعم البرنامج وبرنامج التشغيل للبطاقة المختارة. مواصفات الذاكرة الرسمية لا تثبت توافق البرمجيات. هذا دليل لتقدير السعة يستند إلى وثائق رسمية وصفحات منتجات عامة، وليس مراجعة مبنية على اختبار الأجهزة عملياً؛ لذلك لا يقدم سرعة توليد موحدة أو مضاعفات أداء لجميع النماذج.

7. أسئلة شائعة حول ذاكرة النماذج اللغوية المحلية

هل تكفي VRAM بسعة 16GB لنموذج 8B؟

لا يكفي عدد المعاملات وحده للحكم. تشغل الأوزان النظرية لنموذج 8B سعة 16GB بدقة 16 بت أو 4GB بدقة 4 بت قبل إضافة ذاكرة التشغيل. اختبر الملف الفعلي مع أقصى سياق وإخراج وعدد طلبات تحتاج إليه.

هل يعمل نموذج 32B مكمّم إلى 4 بت دائماً على RTX 4090 بسعة 24GB؟

لا يوجد ضمان عام. تعطي المعادلة المبسطة 16GB للأوزان، لكن الصيغة والذاكرة المؤقتة ومساحة العمل تغير الإجمالي. تحقق كذلك مما إذا كان النموذج يبقى كاملاً على البطاقة أو ينتقل جزء منه إلى RAM.

هل تعوض زيادة RAM نقص VRAM مباشرة؟

ليس تلقائياً. يجب أن يدعم البرنامج النقل إلى المعالج المركزي، وقد تغير عمليات النقل والمعالجة سرعة الاستجابة. قيّم هذا الإعداد بصورة منفصلة عن تشغيل النموذج كاملاً على البطاقة.

هل تستطيع بطاقة تشغّل الاستدلال تدريب النموذج نفسه أيضاً؟

لا تفترض ذلك. يحتفظ التدريب والضبط الدقيق بحالات ونتائج وسيطة إضافية، وتختلف المتطلبات باختلاف الطريقة. راجع وثائق إعداد التدريب المحدد وقِس استهلاكه بدلاً من استخدام ميزانية الاستدلال هذه.

8. المصادر وطريقة الحساب

تم التحقق في 22 سبتمبر 2026. حُسبت أمثلة الأوزان من عدد المعاملات ودقة التخزين، بينما مثال 17GiB ميزانية افتراضية. استُخدمت الوثائق الرسمية للتحقق من مفاهيم الذاكرة والسعات، وصفحات GpuPlus للتحقق من أسماء المنتجات والأسعار والمخزون.

  • [1] Hugging Face Transformers — bitsandbytes: https://huggingface.co/docs/transformers/main/en/quantization/bitsandbytes
  • [2] Hugging Face Transformers — Cache strategies: https://huggingface.co/docs/transformers/main/en/kv_cache
  • [3] MSI — المواصفات الرسمية لبطاقة RTX 5080 16G VANGUARD SOC: https://www.msi.com/Graphics-Card/GeForce-RTX-5080-16G-VANGUARD-SOC/Specification
  • [4] NVIDIA — GeForce RTX 4090: https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/
  • [5] GIGABYTE — المواصفات الرسمية لبطاقة AORUS RTX 5090 MASTER 32G: https://www.gigabyte.com/Graphics-Card/GV-N5090AORUS-M-32GD/sp
  • GpuPlus: صفحات المنتجات المرتبطة أدناه، تم التحقق منها في 22 سبتمبر 2026.