Altum Systems

Cómo dimensionar hardware para correr modelos de IA en local

9 de septiembre de 2026 · Altum Systems

Correr un modelo de lenguaje (LLM) en tu propia infraestructura te da privacidad, control de costos y baja latencia, pero exige dimensionar bien el hardware.

En una frase

El rendimiento se mide en tokens por segundo (tok/s) y lo que más limita es la VRAM: si el modelo no cabe en la memoria de la GPU, todo se vuelve lento.

1. El número clave: tokens por segundo (tok/s)

Un token es la unidad que el modelo lee y genera (unas 3/4 partes de una palabra). La velocidad de generación se mide en tokens por segundo.

Escala orientativa:

05153060+

< 5

Muy lento (solo lotes)

5–15

Legible (sin prisa)

15–30

Fluido (chat)

30–60

Excelente

Regla práctica

Apunta a 15–30 tok/s para una experiencia cómoda. Para procesar documentos en lote, 5–10 tok/s suele bastar.

2. El cuello de botella real: la VRAM

La velocidad depende del cómputo, pero lo que mata el rendimiento es la VRAM (memoria de la GPU): si el modelo no cabe completo, se desborda a RAM o disco y se vuelve lentísimo.

Tamaños típicos de modelo (cuantizado a 4 bits)

Qwen3 8B~5 GB
13B8–9 GB
Qwen3 32B~21 GB
70B40–43 GB

No olvides el margen

Suma 1–3 GB para el contexto (KV cache) y un 10–15% de margen sobre el total.

Cuantización: los modelos se comprimen a Q4 / Q5 / Q8. Q4 reduce mucho la VRAM con pérdida mínima de calidad; Q8 casi duplica el tamaño pero es más fiel.

3. Referencia rápida: canirun.ai

Cómo usarlo

En canirun.ai eliges el modelo y el hardware, y te muestra los tokens por segundo estimados y si el modelo cabe en VRAM. Ideal para comparar configuraciones antes de comprar.

4. GPUs de datacenter recomendadas y su VRAM

NVIDIA L424 GB
NVIDIA L40S48 GB
NVIDIA A10040–80 GB
NVIDIA H10080 GB
NVIDIA H200141 GB
AMD Instinct MI300X192 GB
RTX 5090 (workstation)32 GB

En Altum importamos GPUs NVIDIA de datacenter (L4, L40S, A100, H100, H200) y AMD Instinct bajo pedido.

5. Dividir la carga entre varias GPUs

Hoy un modelo puede repartirse entre varias GPUs mediante tensor parallelism y pipeline parallelism (la carga se divide por capas o por operación). Esto permite correr modelos más grandes que la VRAM de una sola tarjeta.

Ejemplo práctico

Un modelo 70B Q4 (~42 GB) se puede correr en 2× NVIDIA L4 (48 GB en total) o en 1× L40S (48 GB).

Frameworks que lo soportan:

  • vLLM — tensor parallelism para inferencia de alto rendimiento.
  • llama.cpp — divide por capas (--split-mode).
  • ExLlamaV2 — muy eficiente en VRAM.
  • Text Generation Inference (Hugging Face) y Ollama.

NVLink vs PCIe

NVLink da más ancho de banda entre GPUs (mejor para modelos gigantes), pero con PCIe también funciona para la mayoría de casos de inferencia.

6. Regla de oro

Fórmula de dimensionamiento

VRAM necesaria ≈ tamaño del modelo (cuantizado) + contexto (KV cache) + 10–15% de margen. Si supera la VRAM de una GPU, agrega más GPUs y divide la carga.

7. Ejemplos de configuraciones

Qwen3 8B

1× L4 24 GB → 30–50 tok/s

Qwen3 32B

1× L40S 48 GB → 20–30 tok/s

70B

1× H100 80 GB → 15–30 tok/s

multi

Varias H100 con vLLM

¿Necesitas ayuda para dimensionar?

En Altum configuramos servidores con GPUs NVIDIA de datacenter (L4, L40S, A100, H100) y AMD Instinct, con integración y soporte local en Costa Rica.

Cotizar GPUs

Preguntas frecuentes

¿Cuánta VRAM necesito para correr un modelo de IA en local?

La VRAM necesaria es aproximadamente el tamaño del modelo cuantizado + el contexto (KV cache) + un 10–15% de margen. Por ejemplo, un modelo 70B en Q4 usa unos 42 GB y cabe en 1× H100 de 80 GB o en 2× L4 de 24 GB.

¿Qué es la cuantización (Q4, Q5, Q8)?

Es comprimir los pesos del modelo para que ocupen menos VRAM. Q4 reduce mucho el tamaño con pérdida mínima de calidad; Q8 casi duplica el tamaño pero es más fiel al modelo original.

¿Cuántos tokens por segundo (tok/s) es aceptable?

Para chat fluido apunta a 15–30 tok/s. Por debajo de 5 tok/s solo es viable para procesamiento en lote; 30–60 tok/s es excelente.

¿Puedo usar varias GPUs para un modelo grande?

Sí. Con tensor parallelism y pipeline parallelism (vLLM, llama.cpp, ExLlamaV2) un modelo puede repartirse entre varias GPUs y correr modelos más grandes que la VRAM de una sola tarjeta.

¿Dónde comprar GPUs NVIDIA o AMD para IA en Costa Rica?

Altum Systems importa GPUs NVIDIA de datacenter (L4, L40S, A100, H100, H200) y AMD Instinct bajo pedido. Solicita una cotización en la página de contacto.