← GpuPlus Blog

GpuPlus Blog

¿Cuánta VRAM necesita un LLM local? Guía para elegir entre 16GB, 24GB y 32GB

Para elegir una GPU para un LLM local, suma la memoria de los pesos, el contexto, las solicitudes simultáneas y un margen de funcionamiento. La etiqueta de 16GB, 24GB o 32GB no garantiza compatibilidad: primero calcula un presupuesto y después verifica el consumo máximo con la configuración que vas a utilizar.

1. Define el trabajo antes de elegir la GPU

Esta guía trata la inferencia de modelos de lenguaje para generar texto en un ordenador personal. Inferencia significa producir respuestas con un modelo ya entrenado. El entrenamiento completo, el ajuste fino y la generación de imágenes o vídeo tienen otros requisitos; no les apliques directamente estas cifras. Define primero el modelo y las condiciones de uso, antes de comparar generaciones de GPU o resultados en juegos.

  • Anota el nombre exacto, la revisión y el número total de parámetros. Un modelo 8B tiene aproximadamente ocho mil millones de parámetros.
  • Identifica el formato de cuantización del archivo que descargarás y comprueba que el programa lo admite.
  • Fija el máximo de tokens de entrada y salida, y el número de solicitudes simultáneas.
  • Decide si todo el modelo debe permanecer en la GPU o si aceptas trasladar una parte a la RAM del sistema.

Un chat personal que responde preguntas breves de una en una no exige lo mismo que una herramienta que resume varios informes largos a la vez. Poder cargar el modelo y completar la solicitud más larga de tu trabajo son dos pruebas distintas. Cuenta los tokens con el tokenizador real: la relación entre caracteres y tokens cambia según el idioma.

2. Calcula los pesos sin confundirlos con toda la memoria necesaria

Si suponemos que todos los pesos se guardan con la misma precisión, la fórmula simplificada es parámetros × bits por peso ÷ 8 = bytes. Los siguientes valores son cálculos editoriales, no mediciones de rendimiento. GB equivale a mil millones de bytes; GiB, a 1.073.741.824 bytes. Usa la misma unidad al comparar las mediciones con la capacidad de una tarjeta.

  • 8B: pesos de 16 bits, 16GB (14,90GiB); de 8 bits, 8GB (7,45GiB); de 4 bits, 4GB (3,73GiB).
  • 14B: pesos de 16 bits, 28GB (26,08GiB); de 8 bits, 14GB (13,04GiB); de 4 bits, 7GB (6,52GiB).
  • 32B: pesos de 16 bits, 64GB (59,60GiB); de 8 bits, 32GB (29,80GiB); de 4 bits, 16GB (14,90GiB).

Los archivos cuantizados reales incluyen información adicional, como escalas, y pueden conservar algunos tensores con mayor precisión. La documentación de bitsandbytes distingue la cuantización de 4 y 8 bits del tipo de datos usado para calcular[1]. Por tanto, «4 bits» no significa que todas las operaciones y asignaciones de memoria usen cuatro bits. El tamaño de descarga no mide el consumo máximo durante la ejecución.

3. Reserva memoria para el contexto y las solicitudes simultáneas

Separa el presupuesto en pesos cargados, caché KV, espacio temporal, pantalla y otras aplicaciones, y margen de funcionamiento. La caché KV guarda información intermedia utilizada al generar tokens. Hugging Face explica que puede limitar la memoria con contextos largos y que trasladarla a la CPU implica un compromiso entre memoria y velocidad[2].

Considera este ejemplo hipotético: 9GiB de pesos, 5GiB de caché y espacio temporal para la solicitud objetivo, y 1GiB de pantalla y otros usos. Son 15GiB. Si añadimos un margen ilustrativo de 2GiB, el objetivo resulta ser 17GiB. Con esas condiciones hay razones para probar una tarjeta de la clase de 24GB en lugar de dar por suficientes 16GB. Ninguna de esas cifras, incluido el margen, es una recomendación universal.

Vuelve a medir al cambiar el contexto o la concurrencia. Sin conocer la arquitectura de la caché, no supongas que duplicar el contexto duplica exactamente toda la VRAM utilizada. Comprueba también si el programa reserva memoria para la caché por adelantado. Procesar el documento real más largo hasta la longitud de salida deseada aporta más información que medir solo al cargar el modelo.

4. Relaciona el presupuesto con productos reales de GpuPlus

Las fichas oficiales confirman 16GB GDDR7 para MSI RTX 5080 VANGUARD SOC[3], 24GB GDDR6X para NVIDIA RTX 4090[4] y 32GB GDDR7 para GIGABYTE AORUS RTX 5090 MASTER[5]. Estos productos ilustran distintas capacidades; no constituyen una clasificación de velocidad de LLM ni garantizan ejecutar un modelo concreto.

  • Ejemplo de 16GB — MSI RTX 5080 Vanguard SOC: puede ser candidata si todo el trabajo medido cabe holgadamente en la memoria disponible. Precio publicado: 1.254 USDT; existencias: 0 unidades.
  • Ejemplo de 24GB — GIGABYTE RTX 4090 Gaming OC: candidata cuando 16GB no permiten el contexto y el margen necesarios. Precio publicado: 2.400 USDT; existencias: 8 unidades.
  • Ejemplo de 32GB — GIGABYTE AORUS RTX 5090 MASTER: opción para estudiar si el presupuesto supera la clase de 24GB. Tampoco admite todos los modelos grandes. Precio publicado: 3.255 USDT; existencias: 13 unidades.

5. Lista práctica para una comprobación reproducible

Cuando sea posible, prueba en tu equipo o en un entorno de pruebas disponible, usando el mismo modelo, archivo y programa. Revisa esas condiciones también al consultar resultados de otras personas. Comparar tokens por segundo con configuraciones distintas no permite atribuir toda la diferencia a la GPU.

  • Guarda la revisión del modelo, el nombre del archivo, la cuantización y las versiones del programa y del controlador.
  • Cierra las aplicaciones GPU innecesarias y anota el uso de memoria antes y justo después de cargar.
  • Ejecuta la entrada más larga con la salida máxima prevista y registra el pico hasta completar la tarea.
  • Si necesitas concurrencia, repite con el número real de solicitudes y registra los errores de memoria insuficiente.
  • Evalúa por separado el tiempo hasta la primera respuesta, la velocidad de generación y la calidad. Caber en memoria no es el único criterio.
  • Tras actualizar el software, repite la misma entrada y conserva separados el consumo medido y el margen elegido.

6. Conclusión: selecciona capacidad y comprueba el software

Mantén 16GB como candidata si el pico medido más el margen cabe con holgura en la capacidad disponible. En caso contrario, estudia 24GB y después 32GB. Compara siempre en las mismas unidades que utiliza la herramienta de medición. Si incluso la clase de 32GB queda corta, considera un modelo menor, otra cuantización, menos contexto o una descarga a RAM expresamente admitida por el programa.

Comprueba que la combinación del programa y el controlador admite la GPU elegida. La capacidad publicada por el fabricante no demuestra compatibilidad de software. Esta guía de dimensionamiento se basa en documentación oficial y fichas públicas; no es una prueba física del hardware y no asigna velocidades universales ni multiplicadores de rendimiento.

7. Preguntas frecuentes sobre memoria para LLM locales

¿Bastan 16GB de VRAM para un modelo 8B?

El número de parámetros no basta para decidir. Los pesos ideales de 8B ocupan 16GB a 16 bits o 4GB a 4 bits, antes de añadir memoria de ejecución. Comprueba el archivo real con el contexto, la salida y la concurrencia máximos que necesitas.

¿Un modelo 32B de 4 bits funciona siempre en una RTX 4090 de 24GB?

No hay una garantía general. El cálculo simplificado de los pesos da 16GB, pero el formato, la caché y el espacio temporal modifican el total. Comprueba si todo permanece en la GPU o si parte pasa a la RAM del sistema.

¿Añadir RAM del sistema sustituye directamente la VRAM que falta?

No automáticamente. El programa debe admitir descarga a CPU, y las transferencias y el procesamiento en CPU pueden cambiar la respuesta. Evalúa esa configuración por separado de una ejecución completamente residente en GPU.

¿Una GPU que ejecuta inferencia también puede entrenar el mismo modelo?

No lo des por hecho. El entrenamiento y el ajuste fino conservan estados y resultados intermedios adicionales, con requisitos distintos según el método. Consulta la documentación y mide la configuración de entrenamiento específica.

8. Fuentes y método de cálculo

Consulta realizada el 22 de septiembre de 2026. Los pesos se calcularon a partir del número de parámetros y la precisión de almacenamiento; el caso de 17GiB es hipotético. La documentación oficial respalda los conceptos y capacidades, y las páginas de GpuPlus aportan nombres, precios y existencias.

  • [1] Hugging Face Transformers — bitsandbytes: https://huggingface.co/docs/transformers/main/en/quantization/bitsandbytes
  • [2] Hugging Face Transformers — Cache strategies: https://huggingface.co/docs/transformers/main/en/kv_cache
  • [3] MSI — Especificaciones de RTX 5080 16G VANGUARD SOC: https://www.msi.com/Graphics-Card/GeForce-RTX-5080-16G-VANGUARD-SOC/Specification
  • [4] NVIDIA — GeForce RTX 4090: https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/
  • [5] GIGABYTE — Especificaciones de AORUS RTX 5090 MASTER 32G: https://www.gigabyte.com/Graphics-Card/GV-N5090AORUS-M-32GD/sp
  • GpuPlus: fichas de los productos relacionados al final, consultadas el 22 de septiembre de 2026.