Saltar al contenido
mathbehind

Calculadora de coste de LLM: autoalojado frente a API

Compara alquilar GPU para ejecutar un modelo abierto con pagar por token un modelo de API, y encuentra el volumen mensual a partir del cual compensa alojarlo tú mismo.

Tus números

Los precios y tarifas de esta herramienta están en dólares estadounidenses.

M tokens
M tokens
$

De tu proveedor de nube o de GPU para la GPU que necesites. La calculadora de VRAM para LLM locales muestra cuánta memoria de GPU necesita un modelo.

h

730 es siempre encendido. Menos si apagas fuera del horario laboral.

Mídelo con tu modelo, tu servidor y tu tamaño de lote. Varía mucho.

$

Almacenamiento, red, monitorización y una parte del tiempo de ingeniería.

Opción más barata con este volumen

API

Diferencia mensual

1245 US$

Coste de la API al mes
880,00 US$
Coste del autoalojamiento al mes
2125,00 US$
Volumen del punto de equilibrio (con tu proporción de entrada y salida)
5795 M tokens
Capacidad de GPU utilizada
36,5%
Comprobación de capacidad
Dentro de la capacidad
Las cuentas que hay detrás
  1. API

    2000M × 0,20 US$ + 400M × 1,20 US$es igual a880,00 US$

  2. Autoalojamiento

    2,50 US$ × 1 GPU × 730 h + 300 US$es igual a2125,00 US$

  3. Diferencia

    |880,00 US$ − 2125,00 US$|es igual a1245 US$

  4. Punto de equilibrio

    2125,00 US$ ÷ 0,367 US$ por Mes igual a5795M tokens

Ejecutar un modelo abierto en GPU alquiladas tiene un coste mensual fijo, mientras que una API cobra cada token. Con poco volumen, la API casi siempre es más barata; con un volumen alto y constante, alojarlo tú mismo puede salir ganando. Esta calculadora compara ambas opciones para tu carga de trabajo, muestra el volumen mensual de tokens en el que cuestan lo mismo y comprueba si tus GPU pueden soportar realmente el tráfico.

Cifras comprobadas el por Muhammad Ahmad con Precios de la API de OpenAI, Documentación de la plataforma Claude: precios y Precios de la API de Gemini. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas

Cómo funciona

Coste de la API = tokens de entrada (en millones) × el precio de entrada del modelo + tokens de salida (en millones) × su precio de salida, con los precios verificados de la calculadora de costes de API de IA.

Coste del autoalojamiento = precio de la GPU por hora × número de GPU × horas en funcionamiento + otros costes mensuales como almacenamiento, red, monitorización y tiempo de ingeniería. Es el mismo tanto si las GPU están ocupadas como si están inactivas.

Volumen del punto de equilibrio = coste del autoalojamiento ÷ el precio medio de la API por millón de tokens con tu proporción de entrada y salida. Por debajo, la API es más barata; por encima, lo es el autoalojamiento, siempre que las GPU tengan capacidad.

Capacidad = tokens por segundo por GPU × GPU × horas × 3.600. Si tus tokens mensuales la superan, necesitas más GPU, lo que eleva el coste del autoalojamiento. El rendimiento real depende del modelo, del software del servidor, del tamaño del lote y de la longitud de los prompts, así que mídelo en lugar de suponerlo.

Un ejemplo resuelto

2.000 millones de tokens de entrada y 400 millones de salida al mes en GPT-5.6 Luna (0,20 $ de entrada, 1,20 $ de salida) cuestan 880 $ con la API. Una GPU a 2,50 $ la hora funcionando todo el mes cuesta 1.825 $, más 300 $ de otros costes: 2.125 $. La API es 1.245 $ más barata al mes. Su precio medio es de unos 0,37 $ por millón de tokens, así que el autoalojamiento solo llega al punto de equilibrio con unos 5.795 millones de tokens al mes. Esta GPU puede procesar unos 6.570 millones al mes a 2.500 tokens por segundo, de modo que llegar al equilibrio la mantendría ocupada un 88 % del tiempo las 24 horas, con poco margen para los picos.

Más ejemplos

Con GPT-6 Luna como API de comparación, la carga de trabajo por defecto cuesta 400 $ al mes con la API frente a 2.125 $ autoalojada, y el autoalojamiento solo llega al punto de equilibrio con unos 12.750 millones de tokens al mes.

Con 10 veces el volumen por defecto, el autoalojamiento parece más barato (2.125 $ frente a 8.800 $), pero la única GPU supera su capacidad con un 365 % de utilización, así que hacen falta más GPU.

Errores frecuentes

  • Comparar el coste de la GPU con el de la API sin contar el tiempo del personal y las operaciones.
  • Suponer una utilización de la GPU del 100 %.
  • Comparar con un precio antiguo de la API; los precios de las API bajaron con fuerza en 2026.
  • Ignorar las diferencias de calidad entre el modelo abierto y el modelo de la API.

Preguntas frecuentes

¿Cuándo sale más barato autoalojar un LLM que usar una API?

Cuando tu volumen es lo bastante alto y constante como para mantener ocupadas las GPU, y el modelo de API que usarías en otro caso es caro. Frente a modelos de API baratos, el volumen del punto de equilibrio suele ser muy alto.

¿Qué costes añade el autoalojamiento además de las GPU?

Almacenamiento de los pesos del modelo, red, monitorización, escalado para los picos, actualizaciones de seguridad y tiempo de ingenieros. No aparecen en la factura de una API, así que incluye una cifra realista en otros costes mensuales.

¿Cuántos tokens por segundo puede manejar una GPU?

Varía mucho según el tamaño del modelo, la precisión, el software del servidor y cuántas solicitudes se agrupan en lote. Haz una prueba con tu propio modelo y tu configuración; las cifras publicadas rara vez son comparables.

¿La calidad es la misma?

No necesariamente. Un modelo abierto que cabe en una sola GPU puede ser más débil que el modelo de API con el que lo comparas. Compara la calidad en tus propias tareas antes de comparar el coste.

¿Puedo apagar las GPU para ahorrar?

Sí, si el tráfico lo permite. Funcionar solo en horario laboral reduce mucho la factura de GPU, pero las solicitudes fuera de ese horario necesitan una alternativa, a menudo la propia API.