Correr un modelo de lenguaje (LLM) en tu propia infraestructura te da privacidad, control de costos y baja latencia, pero exige dimensionar bien el hardware.
En una frase
El rendimiento se mide en tokens por segundo (tok/s) y lo que más limita es la VRAM: si el modelo no cabe en la memoria de la GPU, todo se vuelve lento.
1. El número clave: tokens por segundo (tok/s)
Un token es la unidad que el modelo lee y genera (unas 3/4 partes de una palabra). La velocidad de generación se mide en tokens por segundo.
Escala orientativa:
< 5
Muy lento (solo lotes)
5–15
Legible (sin prisa)
15–30
Fluido (chat)
30–60
Excelente
Regla práctica
Apunta a 15–30 tok/s para una experiencia cómoda. Para procesar documentos en lote, 5–10 tok/s suele bastar.
2. El cuello de botella real: la VRAM
La velocidad depende del cómputo, pero lo que mata el rendimiento es la VRAM (memoria de la GPU): si el modelo no cabe completo, se desborda a RAM o disco y se vuelve lentísimo.
Tamaños típicos de modelo (cuantizado a 4 bits)
No olvides el margen
Suma 1–3 GB para el contexto (KV cache) y un 10–15% de margen sobre el total.
Cuantización: los modelos se comprimen a Q4 / Q5 / Q8. Q4 reduce mucho la VRAM con pérdida mínima de calidad; Q8 casi duplica el tamaño pero es más fiel.
3. Referencia rápida: canirun.ai
Cómo usarlo
En canirun.ai eliges el modelo y el hardware, y te muestra los tokens por segundo estimados y si el modelo cabe en VRAM. Ideal para comparar configuraciones antes de comprar.
4. GPUs de datacenter recomendadas y su VRAM
En Altum importamos GPUs NVIDIA de datacenter (L4, L40S, A100, H100, H200) y AMD Instinct bajo pedido.
5. Dividir la carga entre varias GPUs
Hoy un modelo puede repartirse entre varias GPUs mediante tensor parallelism y pipeline parallelism (la carga se divide por capas o por operación). Esto permite correr modelos más grandes que la VRAM de una sola tarjeta.
Ejemplo práctico
Un modelo 70B Q4 (~42 GB) se puede correr en 2× NVIDIA L4 (48 GB en total) o en 1× L40S (48 GB).
Frameworks que lo soportan:
- vLLM — tensor parallelism para inferencia de alto rendimiento.
- llama.cpp — divide por capas (
--split-mode). - ExLlamaV2 — muy eficiente en VRAM.
- Text Generation Inference (Hugging Face) y Ollama.
NVLink vs PCIe
NVLink da más ancho de banda entre GPUs (mejor para modelos gigantes), pero con PCIe también funciona para la mayoría de casos de inferencia.
6. Regla de oro
Fórmula de dimensionamiento
VRAM necesaria ≈ tamaño del modelo (cuantizado) + contexto (KV cache) + 10–15% de margen. Si supera la VRAM de una GPU, agrega más GPUs y divide la carga.
7. Ejemplos de configuraciones
Qwen3 8B
1× L4 24 GB → 30–50 tok/s
Qwen3 32B
1× L40S 48 GB → 20–30 tok/s
70B
1× H100 80 GB → 15–30 tok/s
multi
Varias H100 con vLLM
¿Necesitas ayuda para dimensionar?
En Altum configuramos servidores con GPUs NVIDIA de datacenter (L4, L40S, A100, H100) y AMD Instinct, con integración y soporte local en Costa Rica.
Cotizar GPUs