¿Se puede ampliar la VRAM de una tarjeta gráfica para IA?

En el mundo del desarrollo de inteligencia artificial, una de las preguntas más frecuentes es si existe alguna forma de ampliar la VRAM (memoria de video) de una tarjeta gráfica avanzada. ¿Podemos simplemente añadirle más memoria a una GPU como haríamos con la RAM de un PC? La respuesta corta y directa es que no.

Macro shot of a graphics card PCB showing directly soldered VRAM chips with no expansion slots.
La VRAM en tarjetas gráficas avanzadas está soldada directamente al PCB, lo que hace imposible su ampliación modular actual.

En la actualidad, incluso en las tarjetas gráficas más avanzadas para IA, como las de la línea RTX o los servidores con chips H100 y A100, la VRAM está soldada directamente sobre el PCB (placa de circuito) de la tarjeta. Esto se debe a razones críticas de rendimiento: la latencia, el ancho de banda, el consumo energético y la fiabilidad del hardware hacen que cualquier intento de modularidad sea imposible.

Escalar memoria mediante múltiples GPUs

Aunque no podemos ampliar una sola tarjeta, sí existen plataformas profesionales diseñadas para escalar la capacidad de memoria total combinando varias unidades. En entornos especializados como servidores de NVIDIA con GPUs A100 o H100, se puede aumentar la capacidad de memoria conectando múltiples tarjetas a través de interconexiones de altísima velocidad como NVLink y NVSwitch.

Un ejemplo claro es el sistema DGX A100 de NVIDIA, que integra 8 GPUs con hasta 40 GB o 80 GB de HBM2e cada una. Gracias al uso conjunto de estas tarjetas interconectadas, se logra acceder a hasta 640 GB de VRAM efectiva compartida para entrenar modelos masivos como GPT o DALL·E.

De manera similar, AMD ofrece configuraciones con su línea Instinct MI que utilizan Infinity Fabric para conectar múltiples GPUs y acceder a memoria HBM3. Incluso NVIDIA ha lanzado el Superchip Grace Hopper, que une una CPU ARM con una GPU H100 en un entorno de coherencia de memoria.

Alternativas realistas con poco presupuesto

Sin embargo, no es necesario gastar decenas de miles de dólares para trabajar con modelos grandes. Existen formas realistas de escalar la memoria y el rendimiento utilizando hardware más accesible o técnicas de software.

Illustration of a home multi-GPU cluster setup with used graphics cards and power cables.
Montar un clúster casero con varias GPUs de segunda mano es una forma efectiva de escalar la memoria total para IA.

Puedes utilizar librerías como PyTorch con FSDP (Fully Sharded Data Parallel) o DeepSpeed Zero-3, que permiten entrenar modelos que no caben en una sola GPU. También es posible realizar un offload parcial a la CPU y la RAM de tu sistema para liberar espacio en la tarjeta gráfica.

Otra opción muy popular es montar un clúster casero utilizando tarjetas gráficas de segunda mano, como las RTX 2080 Ti o las RTX 3060 de 12 GB. Al conectarlas mediante placas base con múltiples slots PCIe y usar frameworks como PyTorch DDP, puedes dividir el modelo y la memoria entre ellas para entrenar modelos medianos.

Si prefieres evitar el hardware físico, los servicios en la nube ofrecen acceso a GPUs potentes por horas o mensualmente. Plataformas como Google Colab Pro+, RunPod.io, Lambda Labs o AWS permiten alquilar tarjetas con mucha VRAM sin tener que comprarlas.

Laptop displaying a large language model with a cloud server icon hovering above it.
El uso de servicios en la nube y la cuantización permite ejecutar modelos grandes con un presupuesto ajustado.

Finalmente, la cuantización de modelos es una herramienta esencial para presupuestos ajustados. Convertir modelos a versiones más ligeras, como INT8, 4-bit o formatos GGUF, te permite ejecutar LLMs en laptops con poca memoria o incluso usar herramientas como llama.cpp sin necesidad de hardware especializado.

En conclusión, aunque no existe una tarjeta gráfica con slots para ampliar la VRAM individualmente, las soluciones actuales se centran en el uso conjunto de múltiples GPUs interconectadas, el offload a CPU/RAM y el aprovechamiento de servicios cloud o cuantización. Estas estrategias permiten trabajar con modelos grandes sin necesidad de inversiones masivas.