Las páginas de precios de la IA indican una tarifa por millón de tokens, lo que no responde a la pregunta del presupuesto: ¿cuánto cuesta una llamada y cuánto costará con tu volumen? Esta calculadora convierte las tarifas publicadas de cada modelo en un coste por solicitud y mensual. Puedes introducir los tamaños en tokens, palabras, líneas de código o caracteres, y modelar la caché de prompts y el procesamiento por lotes, donde más ahorran las cargas de trabajo con documentos grandes.
Cifras comprobadas el por Muhammad Ahmad con Precios de la API de OpenAI, Precios de la API de Claude y Precios de la API de Gemini. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas
Cómo funciona
Los proveedores facturan los tokens de entrada (todo lo que envías: instrucciones, documentos, conversación) y los tokens de salida (la respuesta) a tarifas distintas. Coste por solicitud = tokens de entrada × precio de entrada + tokens de salida × precio de salida, con ambos precios indicados por 1.000.000 de tokens.
Si introduces palabras, líneas o caracteres, primero se convierten a tokens. El inglés promedia unos 1,33 tokens por palabra; el árabe y el urdu necesitan aproximadamente de 2 a 3, porque los tokenizadores se entrenan sobre todo con inglés. El código varía según el lenguaje y la longitud de la línea. Para recuentos exactos, usa el contador de tokens del proveedor e introduce tokens.
La caché de prompts cobra una tarifa mucho menor por la entrada que el proveedor ha visto hace poco, como un prompt del sistema largo o un contrato sobre el que haces muchas preguntas. Introduce el porcentaje de cada solicitud que se repite y el precio en caché como porcentaje del precio normal. El procesamiento por lotes cambia velocidad por un descuento en las solicitudes que pueden esperar, como las ejecuciones nocturnas de documentos.
Coste mensual = coste por solicitud × solicitudes al mes. Los precios cambian a menudo: la lista de modelos de aquí se comprobó con las páginas oficiales de precios en la fecha indicada, y las tarifas de caché y de lotes las fijas tú a partir de la página actual del proveedor.
Un ejemplo resuelto
Resumir un documento en inglés de 10.000 palabras en una respuesta de 1.000 palabras son unos 13.300 tokens de entrada y 1.330 de salida. Con Claude Sonnet 5 (2 $ de entrada y 10 $ de salida por millón), cada llamada cuesta 0,0399 $, o 239,40 $ al mes con 200 llamadas al día (6.000 al mes). Si la mitad de la entrada se sirve desde la caché al 10 % del precio de entrada, el coste baja a 0,02793 $ por llamada y 167,58 $ al mes.
Más ejemplos
Las 10.000 solicitudes por defecto (5.000 tokens de entrada y 1.000 de salida cada una) cuestan 10 $ al mes con GPT-6 Luna, 200 $ con GPT-6 Sol o Claude Sonnet 5, y 400 $ con Claude Opus 5.5.
Con el 80 % de cada prompt en caché, GPT-6 Sol baja de 200 $ a 128 $, y la salida pasa a ser la mayor parte de la factura.
Errores frecuentes
- Comparar los precios de entrada e ignorar los de salida, que suelen costar varias veces más.
- Olvidar los tokens de razonamiento, que se facturan como salida.
- Usar precios antiguos; GPT-6 Sol y Luna redujeron a la mitad los niveles medio y bajo de OpenAI el 22 de septiembre de 2026.
- Ignorar los descuentos de caché y de lotes.
Preguntas frecuentes
¿Cuántos tokens es una palabra?
En inglés, unos 1,33 tokens por palabra de media, o aproximadamente 4 caracteres por token. Las palabras cortas y comunes suelen ser un token; las largas o poco frecuentes se dividen en varios. El árabe, el urdu y muchos otros idiomas usan más tokens por palabra.
¿Por qué los tokens de salida cuestan más que los de entrada?
Los tokens de entrada se procesan juntos en una sola pasada, pero los de salida se generan uno a uno, y cada uno necesita su propia pasada por el modelo. Ese cómputo adicional es la razón por la que la salida suele costar varias veces más que la entrada.
¿Cuánto ahorra la caché de prompts?
Depende de cuánto de cada solicitud se repite y del precio de caché del proveedor. La entrada en caché suele cobrarse a una pequeña fracción de la tarifa normal, de modo que una carga de trabajo que reenvía un documento largo o un prompt del sistema puede reducir su coste de entrada en más de la mitad. Algunos proveedores también cobran por escribir en la caché.
¿Por qué el árabe y el urdu son más caros por palabra?
La mayoría de los tokenizadores aprendieron su vocabulario sobre todo de texto en inglés, así que las palabras en otras escrituras se dividen en más piezas. El precio por token es el mismo, pero cada palabra cuesta más tokens, a menudo de dos a tres veces más.
¿Cuándo debo usar el procesamiento por lotes?
Para trabajos que no necesitan una respuesta inmediata: resumir un archivo de documentos, etiquetar tickets de soporte por la noche o ejecutar evaluaciones. Las solicitudes por lotes suelen devolverse en un día con un descuento sobre el precio estándar.
Guías
- ¿Cuánta VRAM necesitas para ejecutar un LLM en local?La memoria de GPU de un modelo local sale de tres partes: los pesos, la caché KV y la sobrecarga del runtime. Aquí tienes cómo estimar cada una y por qué la cuantización importa más que cualquier otra cosa.
- Cómo estimar y reducir los costes de la API de un LLMLas facturas de las API salen de los tokens de entrada y de salida, que se cobran por separado. Con tres números por petición puedes estimar la factura mensual y comparar modelos antes de escribir una sola línea de código.