Ejecutar un modelo abierto en GPU alquiladas tiene un coste mensual fijo, mientras que una API cobra cada token. Con poco volumen, la API casi siempre es más barata; con un volumen alto y constante, alojarlo tú mismo puede salir ganando. Esta calculadora compara ambas opciones para tu carga de trabajo, muestra el volumen mensual de tokens en el que cuestan lo mismo y comprueba si tus GPU pueden soportar realmente el tráfico.
Cifras comprobadas el por Muhammad Ahmad con Precios de la API de OpenAI, Documentación de la plataforma Claude: precios y Precios de la API de Gemini. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas
Cómo funciona
Coste de la API = tokens de entrada (en millones) × el precio de entrada del modelo + tokens de salida (en millones) × su precio de salida, con los precios verificados de la calculadora de costes de API de IA.
Coste del autoalojamiento = precio de la GPU por hora × número de GPU × horas en funcionamiento + otros costes mensuales como almacenamiento, red, monitorización y tiempo de ingeniería. Es el mismo tanto si las GPU están ocupadas como si están inactivas.
Volumen del punto de equilibrio = coste del autoalojamiento ÷ el precio medio de la API por millón de tokens con tu proporción de entrada y salida. Por debajo, la API es más barata; por encima, lo es el autoalojamiento, siempre que las GPU tengan capacidad.
Capacidad = tokens por segundo por GPU × GPU × horas × 3.600. Si tus tokens mensuales la superan, necesitas más GPU, lo que eleva el coste del autoalojamiento. El rendimiento real depende del modelo, del software del servidor, del tamaño del lote y de la longitud de los prompts, así que mídelo en lugar de suponerlo.
Un ejemplo resuelto
2.000 millones de tokens de entrada y 400 millones de salida al mes en GPT-5.6 Luna (0,20 $ de entrada, 1,20 $ de salida) cuestan 880 $ con la API. Una GPU a 2,50 $ la hora funcionando todo el mes cuesta 1.825 $, más 300 $ de otros costes: 2.125 $. La API es 1.245 $ más barata al mes. Su precio medio es de unos 0,37 $ por millón de tokens, así que el autoalojamiento solo llega al punto de equilibrio con unos 5.795 millones de tokens al mes. Esta GPU puede procesar unos 6.570 millones al mes a 2.500 tokens por segundo, de modo que llegar al equilibrio la mantendría ocupada un 88 % del tiempo las 24 horas, con poco margen para los picos.
Más ejemplos
Con GPT-6 Luna como API de comparación, la carga de trabajo por defecto cuesta 400 $ al mes con la API frente a 2.125 $ autoalojada, y el autoalojamiento solo llega al punto de equilibrio con unos 12.750 millones de tokens al mes.
Con 10 veces el volumen por defecto, el autoalojamiento parece más barato (2.125 $ frente a 8.800 $), pero la única GPU supera su capacidad con un 365 % de utilización, así que hacen falta más GPU.
Errores frecuentes
- Comparar el coste de la GPU con el de la API sin contar el tiempo del personal y las operaciones.
- Suponer una utilización de la GPU del 100 %.
- Comparar con un precio antiguo de la API; los precios de las API bajaron con fuerza en 2026.
- Ignorar las diferencias de calidad entre el modelo abierto y el modelo de la API.
Preguntas frecuentes
¿Cuándo sale más barato autoalojar un LLM que usar una API?
Cuando tu volumen es lo bastante alto y constante como para mantener ocupadas las GPU, y el modelo de API que usarías en otro caso es caro. Frente a modelos de API baratos, el volumen del punto de equilibrio suele ser muy alto.
¿Qué costes añade el autoalojamiento además de las GPU?
Almacenamiento de los pesos del modelo, red, monitorización, escalado para los picos, actualizaciones de seguridad y tiempo de ingenieros. No aparecen en la factura de una API, así que incluye una cifra realista en otros costes mensuales.
¿Cuántos tokens por segundo puede manejar una GPU?
Varía mucho según el tamaño del modelo, la precisión, el software del servidor y cuántas solicitudes se agrupan en lote. Haz una prueba con tu propio modelo y tu configuración; las cifras publicadas rara vez son comparables.
¿La calidad es la misma?
No necesariamente. Un modelo abierto que cabe en una sola GPU puede ser más débil que el modelo de API con el que lo comparas. Compara la calidad en tus propias tareas antes de comparar el coste.
¿Puedo apagar las GPU para ahorrar?
Sí, si el tráfico lo permite. Funcionar solo en horario laboral reduce mucho la factura de GPU, pero las solicitudes fuera de ese horario necesitan una alternativa, a menudo la propia API.