Todas las grandes API de LLM facturan por tokens, no por palabras ni por caracteres, pero casi todo el mundo piensa en palabras al redactar un prompt. Esta calculadora convierte entre ambos con la regla general para texto en inglés (unas 750 palabras por cada 1.000 tokens) para que puedas estimar el uso de tokens antes de escribir una sola línea de código de la API.
Cifras comprobadas el por Muhammad Ahmad con Ayuda de OpenAI: qué son los tokens y cómo contarlos. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas
Cómo funciona
La conversión usa la aproximación muy difundida de que 1.000 tokens son unas 750 palabras de texto típico en inglés. Dicho de otro modo, 1 token son aproximadamente 0,75 palabras, o unos 4 caracteres.
Es una heurística, no un recuento exacto. Los tokenizadores reales (como tiktoken de OpenAI o el tokenizador de Anthropic) dividen el texto en fragmentos de subpalabras según el vocabulario de entrenamiento del modelo, así que la puntuación, los números, el código, el texto que no está en inglés y los formatos inusuales pueden desplazar el recuento real de tokens de forma notable por encima o por debajo de esta estimación.
Para una estimación rápida de planificación (dimensionar un prompt, comprobar que cabe en una ventana de contexto o calcular a grandes rasgos el coste antes de usar la calculadora de coste de API de IA), esta aproximación suele ser suficientemente buena. Para recuentos críticos de facturación, usa el tokenizador oficial del proveedor del modelo.
Un ejemplo resuelto
750 palabras de prosa inglesa típica se convierten en unos 1.000 tokens estimados y unos 4.000 caracteres, una referencia útil antes de comprobar un prompt con el límite exacto de la ventana de contexto de un modelo.
Más ejemplos
200.000 tokens son unas 150.000 palabras en inglés, unos 800.000 caracteres, más o menos la extensión de dos novelas.
Errores frecuentes
- Aplicar la regla general del inglés al código o a otros idiomas, que usan más tokens por palabra.
- Suponer que el tokenizador de todos los modelos cuenta igual.
- Olvidar los prompts del sistema, las definiciones de herramientas y el historial, que también cuentan como tokens.
- Usar estimaciones para facturar; usa el contador de tokens del proveedor cuando importe la precisión.
Preguntas frecuentes
¿Por qué 1 token no equivale a 1 palabra?
Los tokenizadores dividen el texto en fragmentos de subpalabras, no en palabras completas. Las palabras comunes suelen ser un solo token, mientras que las palabras más largas o menos comunes se dividen en varios. De media, esto equivale a unas 0,75 palabras por token en un texto típico en inglés, de donde sale la estimación de unas 750 palabras por 1.000 tokens.
¿Sirve para código o para texto que no está en inglés?
Con menos precisión. El código tiende a usar más tokens por carácter que la prosa por los símbolos, la sangría y los identificadores; los idiomas distintos del inglés (sobre todo los de escrituras no latinas) suelen tokenizarse peor que el inglés, y a veces necesitan de 2 a 3 veces más tokens para la misma cantidad aparente de texto.
¿Cómo obtengo un recuento exacto de tokens en lugar de una estimación?
Usa el tokenizador del propio proveedor. OpenAI publica tiktoken, y Anthropic y Google ofrecen sus propios endpoints y bibliotecas de recuento de tokens. Esta calculadora es para planificar rápido, no para una cifra con la que quieras facturar a un cliente.
¿Qué relación tiene con la calculadora de coste de API de IA?
Esta herramienta estima cuántos tokens usará tu texto; la calculadora de coste de API de IA convierte un recuento de tokens en un coste en dólares para un modelo concreto. Usa esta primero si solo conoces el número de palabras de tu prompt y después introduce la estimación de tokens en la calculadora de costes.
¿Cuántas palabras son 1.000 tokens?
Unas 750 palabras en inglés, a razón de unos 1,33 tokens por palabra. En árabe, urdu y muchos otros idiomas son menos palabras, a menudo de 350 a 500, porque cada palabra ocupa más tokens.