Un agente de IA no hace una sola llamada al modelo por tarea. Planifica, llama a una herramienta, lee el resultado y vuelve a llamar al modelo, a menudo muchas veces. Cada llamada reenvía todo lo reunido hasta ese momento, así que el coste de una tarea crece mucho más rápido que su número de pasos. Esta calculadora modela ese bucle para que puedas poner precio a una función de agente antes de que llegue el tráfico real.
Cifras comprobadas el por Muhammad Ahmad con Documentación de la plataforma Claude: precios, Precios de la API de OpenAI y Precios de la API de Gemini. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas
Cómo funciona
Cada paso envía el prompt fijo (instrucciones del sistema y definiciones de herramientas) más el contexto acumulado por los pasos anteriores: la salida de cada paso previo y los resultados de herramientas que produjo.
Para n pasos, entrada total = n × prompt + (salida + resultados de herramientas) × n(n − 1) ÷ 2. El segundo término es el contexto acumulado, y crece con el cuadrado del número de pasos. Salida total = n × salida por paso.
Coste por ejecución = tokens de entrada ÷ 1.000.000 × el precio de entrada del modelo + tokens de salida ÷ 1.000.000 × su precio de salida. Los reintentos lo multiplican: una tasa de reintentos del 10 % hace que la tarea media cueste 1,1 ejecuciones.
Los precios proceden del mismo conjunto de datos verificado que la calculadora de costes de API de IA. La calculadora usa tarifas estándar, por lo que la caché de prompts, que muchos proveedores aplican al prompt repetido, reduciría la factura real.
Un ejemplo resuelto
Un agente de 8 pasos con un prompt de 3.000 tokens, 400 tokens de salida y 800 tokens de resultados de herramientas por paso envía 57.600 tokens de entrada y 3.200 de salida por ejecución. Solo el último paso lleva 11.400 tokens de entrada. Con Claude Sonnet 5 (2 $ de entrada, 10 $ de salida por millón) eso son 0,1472 $ por ejecución, o 0,1619 $ por tarea con un 10 % de reintentos: 161,92 $ al mes por 1.000 tareas. Más de la mitad de la entrada, el 58,3 %, es contexto acumulado y no el prompt fijo.
Más ejemplos
Duplicar un agente de 8 a 16 pasos eleva el coste por tarea de 0,16 $ a 0,49 $, unas tres veces más, porque cada paso reenvía el contexto creciente.
Con GPT-6 Sol la tarea por defecto cuesta lo mismo que con Claude Sonnet 5, 0,16 $, ya que ambos cotizan a 2 $ / 10 $ por millón de tokens.
Errores frecuentes
- Estimar el coste por paso en lugar de por tarea completada.
- Olvidar los reintentos y las ejecuciones fallidas.
- Dejar que el contexto crezca sin recortarlo ni resumirlo.
- Usar el modelo más caro en todos los pasos en lugar de derivar los pasos sencillos a modelos más baratos.
Preguntas frecuentes
¿Por qué los agentes de IA cuestan más que los chatbots?
Los agentes hacen muchas llamadas al modelo por tarea y devuelven los resultados de las herramientas, así que cada llamada lleva más contexto que la anterior. Una tarea de 8 pasos puede usar fácilmente diez veces los tokens de una sola respuesta de chat.
¿Cómo puedo reducir los costes de un agente de IA?
Guarda en caché el prompt fijo y las definiciones de herramientas, recorta o resume los resultados de las herramientas antes de devolverlos, limita el número de pasos y deriva los pasos sencillos a un modelo más barato.
¿Se incluyen los tokens de pensamiento o de razonamiento?
Ponlos en la salida por paso. Los proveedores facturan los tokens de razonamiento como salida, y en las tareas largas pueden ser la mayor parte de la factura de salida.
¿La caché de prompts cambia el resultado?
Sí. La mayoría de los proveedores facturan la entrada en caché a una fracción de la tarifa estándar, y los agentes repiten el mismo prompt en cada paso. Trata este resultado como una estimación máxima si usas caché.
¿Puede un modelo más caro salir más barato para agentes?
A veces. Un modelo más potente que termina en menos pasos, o que falla menos, puede costar menos por tarea que un modelo barato que entra en bucle. Compara el coste por tarea completada, no el precio por token.