Uno de los motivos por el que la gráfica NVIDIA RTX 5090 es la mejor opción para tareas de Inteligencia Artificial de forma local es por contar con 32 GB de VRAM. Las IA necesitan mucha VRAM porque durante la inferencia (cuando generan una respuesta) y el entrenamiento tienen que mantener una enorme cantidad de datos accesibles de forma inmediata.
Si toda la información no cabe en la VRAM, memoria mucho más rápida que la RAM, la Inteligencia Artificial tiene que recurrir a la memoria RAM del equipo, ralentizando los procesos de inferencia y entrenamiento.
El proceso de entrenamiento de una IA consume todavía más memoria que el proceso de inferencia, concretamente entre 3 y 8 veces más memoria. Este es uno de los motivos por el que las gráficas de uso doméstico de AMD, Intel y NVIDIA no se utilizan para entrenar modelos de lenguaje, sino para ejecutarlos.
¿Por qué la IA consume tanta VRAM?
El elevado consumo de VRAM de la Inteligencia Artificial se debe a tres factores:
Los parámetros del modelo
Cuando hablamos de parámetros de un LLM, hablamos del conjunto de datos que define todo lo que sabe. Por ejemplo, Llama-3-8B, cuenta con 8.000 millones de parámetros. Cada uno de esos parámetros es un número decimal y dependiendo de la precisión con la que se guarden, ocupan más o menos espacio.
- FP16 (sin compresión). Cada parámetro ocupa 2 bytes. Para calcular la cantidad de memoria que necesitamos para abrir un modelo con 8.000 millones de parámetros, debemos multiplicar esa cifra por 2 bytes y nos da un total de 16 GB, cantidad de VRAM solo necesaria para abrir el modelo.
- INT4 (comprimido). Utilizando diferentes técnicas de compresión se reduce el tamaño de 0,5 bytes por parámetro. De esta forma, para abrir un modelo de lenguaje con 8.000 millones de parámetros, solo necesitamos 6 GB VRAM.
| Parámetros del Modelo | Precisión FP16 (16 bits) | Cuantización INT4 (4 bits) |
|---|---|---|
| 7B (7.000 millones) | ~14 GB | ~4–5 GB |
| 13B (13.000 millones) | ~26 GB | ~8–10 GB |
| 70B (70.000 millones) | >140 GB | ~40–50 GB |
La memoria a corto plazo
Cargar el modelo es solo el principio. Cuando estás interactuando con una IA, cada vez que genera un nuevo token (la unidad de medida que usa el modelo, que suele ser una palabra corta o parte de una de ella), necesita recordar todo lo que se ha dicho antes en la conversación.
Para no recalcular el significado de todo el texto desde cero con cada token nuevo, la tarjeta gráfica guarda las operaciones anteriores en un búfer llamado KV Cache.
Esta caché crece de forma lineal con la cantidad de tokens del texto (contexto) y el número de usuarios simultáneos. Si le pides a la IA que analice un PDF de 200 páginas o mantienes una conversación larguísima, el KV Cache puede llegar a ocupar fácilmente más VRAM que el propio modelo.
Los cálculos paralelos
Si bien es cierto que la IA también puede utilizar la RAM cuando la VRAM es escasa, el principal motivo para no depender de esta es el ancho de banda, ya que la IA procesa miles de millones de operaciones matemáticas en paralelo.
La memoria RAM DDR5 tiene un ancho de banda de entre 50 y 90 GB/s, mientras que la VRAM GDDR7 tiene un ancho de banda máximo de 2.000 GB/s.
| Memoria | Ancho de banda aproximado |
|---|---|
| DDR5 RAM | 50–90 GB/s |
| GDDR6 | 300–700 GB/s |
| GDDR6X | 700–1.100 GB/s |
| GDDR7 | 1.000–2.000+ GB/s |
Es mejor una NPU o una gráfica con mucha VRAM
Sí, utilizar una NPU (Unidad de Procesamiento Neuronal) tiene ventajas muy claras sobre una tarjeta gráfica (GPU) con mucha VRAM, pero no en fuerza bruta o tamaño de los modelos, sino en eficiencia, coste y portabilidad.
Las ventajas reales de un NPU sobre una GPU con mucha VRAM se dividen en 4 apartados.
- Eficiencia energética. Un NPU está diseñada únicamente para multiplicar matrices (la matemática básica de la IA) eliminando todas las funciones relacionadas con videojuegos. Gracias a esto, un NPU realiza las mismas tareas de inferencia consumiendo apenas entre 1 y 5 vatios, en lugar de los hasta 600W que puede consumir la RTX 5090.
- Siempre en funcionamiento. Los NPU están pensados para integrarse en el sistema operativo y gestionar tareas ligeras pero constantes sin interrumpir tu trabajo.
- Factor coste y tamaño. Mientras que una gráfica con mucha VRAM dedicada puede costar miles de euros y requieren de un espacio dedicado, la NPU está integrada junto con el procesador y la gráfica.
- Arquitectura unificada. Aunque los NPU integrados no tienen «VRAM» propia como una tarjeta gráfica dedicada, aprovechan la Memoria Unificada del sistema
| Escenario | ¿Quién gana? | ¿Por qué? |
|---|---|---|
| Modelos gigantescos (LLMs de más de 30B parámetros) o Entrenar tu propia IA | GPU con mucha VRAM 🏆 | Por pura fuerza bruta, potencia de cálculo cruda y un ancho de banda de memoria insuperable. |
| Modelos optimizados/comprimidos (hasta 8B o 13B), asistentes de voz, portabilidad y batería | NPU 🏆 | Es infinitamente más eficiente, barato, silencioso y no consume la batería de tus dispositivos. |
