Saltar al contenido
mathbehind

Calculadora de coste de un pipeline RAG

Reúne los embeddings, el almacenamiento de vectores y la generación de respuestas en una sola cifra mensual para una aplicación de generación aumentada por recuperación (RAG), con el coste por consulta.

Tus números

Los precios y tarifas de esta herramienta están en dólares estadounidenses.

M tokens

Unas 750.000 palabras equivalen a 1 millón de tokens.

tokens
%

Documentos nuevos y modificados.

$

De la página de precios de tu proveedor de embeddings.

$

De la página de precios de tu base de datos vectorial. Introduce 0 si el almacenamiento está incluido en un plan de tarifa plana.

tokens
tokens

Coste mensual de funcionamiento

460,44 US$

Coste por pregunta

0,00460 US$

Generación de respuestas al mes
460,00 US$
Reincorporación de embeddings al mes
0,10 US$
Almacenamiento de vectores al mes
0,24 US$
Embeddings de las preguntas al mes
0,10 US$
Coste único de generar embeddings de todo
1,00 US$
Fragmentos (vectores) almacenados
100.000
Almacenamiento de vectores
0,74 GB
Las cuentas que hay detrás
  1. Vectores

    50.000.000 tokens ÷ 500es igual a100.000

  2. Almacenamiento

    0,74 GB × 0,33 US$es igual a0,24 US$

  3. Respuestas

    (3100 ÷ 1M × 1,00 US$ + 300 ÷ 1M × 5,00 US$) × 100.000es igual a460,00 US$

  4. Al mes

    460,00 US$ + 0,10 US$ + 0,24 US$ + 0,10 US$es igual a460,44 US$

Una aplicación de generación aumentada por recuperación (RAG) tiene varias partidas de coste que suelen tarificarse en sitios distintos: generar embeddings de tus documentos, almacenar los vectores, generar el embedding de cada pregunta y generar cada respuesta con el texto recuperado incluido. Esta calculadora las suma en una cifra mensual y un coste por pregunta, para que veas qué partida importa de verdad.

Cifras comprobadas el por Muhammad Ahmad con Documentación de la plataforma Claude: precios, Precios de la API de OpenAI y Precios de la API de Gemini. Los precios y las normas cambian, así que confírmalos con la fuente oficial antes de basarte en ellos. Cómo verificamos las cuentas

Cómo funciona

Tus documentos se dividen en fragmentos y cada fragmento se convierte en embedding una vez: fragmentos = tokens de los documentos ÷ tamaño del fragmento, y el coste único de los embeddings = tokens de los documentos ÷ 1.000.000 × el precio de los embeddings. Volver a generar los embeddings de los documentos nuevos y modificados cada mes cuesta esa parte de la cifra única.

Cada vector ocupa dimensiones × 4 bytes como números de coma flotante de 32 bits. La calculadora añade un 20 % para las estructuras de índice y los metadatos, y luego multiplica los gigabytes por el precio mensual de tu base de datos vectorial.

Cada pregunta envía los fragmentos recuperados (fragmentos por pregunta × tamaño del fragmento) más las instrucciones y la pregunta al modelo de respuesta, que escribe la respuesta. Ese coste de generación usa los precios verificados de los modelos de la calculadora de costes de API de IA. El embedding de la propia pregunta se cuenta como 50 tokens.

Los precios de embeddings y de almacenamiento varían según el proveedor y cambian, por lo que son datos de entrada: introduce las cifras de las páginas de precios de tus propios proveedores. Los valores por defecto son ejemplos.

Un ejemplo resuelto

50 millones de tokens de documentos en fragmentos de 500 tokens son 100.000 vectores. Con 1.536 dimensiones son unos 0,74 GB con la sobrecarga, así que el almacenamiento a 0,33 $ por GB-mes cuesta unos 0,24 $. Generar los embeddings de todo una vez cuesta 1,00 $ a 0,02 $ por millón de tokens, y volver a generar el 10 % cada mes cuesta 0,10 $. La partida grande es responder: 100.000 preguntas, cada una con 3.100 tokens de entrada y 300 de respuesta, cuestan 460 $ al mes con Claude Haiku 4.5. El total es de unos 460,44 $ al mes, menos de medio céntimo por pregunta.

Más ejemplos

Si GPT-6 Luna genera las respuestas en lugar de Claude Haiku 4.5, el pipeline por defecto de 100.000 consultas baja de 460,44 $ a 46,44 $ al mes. Los embeddings y el almacenamiento suman menos de 1 $ en ambos casos.

Errores frecuentes

  • Centrarse en el coste de los embeddings cuando domina la generación.
  • Recuperar demasiados fragmentos, lo que infla cada prompt.
  • Volver a generar los embeddings de todo el corpus cuando solo hay que hacerlo con los documentos modificados.
  • Ignorar la calidad de la recuperación, que importa más que las pequeñas diferencias de coste.

Preguntas frecuentes

¿Cuál es la parte más cara de un sistema RAG?

Normalmente la generación de respuestas, porque cada pregunta envía al modelo los fragmentos recuperados. Generar los embeddings de los documentos suele ser un coste único pequeño, y el almacenamiento de vectores es modesto hasta que tienes muchos millones de vectores.

¿Cómo puedo reducir los costes de RAG?

Recupera menos fragmentos o más pequeños, reordénalos para quedarte solo con los mejores, guarda en caché las preguntas frecuentes y usa un modelo de respuesta más pequeño donde la calidad lo permita. Reducir el contexto recuperado de 5 fragmentos a 3 disminuye la entrada de cada pregunta.

¿Cuánto almacenamiento usan los embeddings?

Dimensiones × 4 bytes por vector como números de coma flotante de 32 bits: 1.536 dimensiones son unos 6 KB. Los índices y los metadatos añaden más. Los embeddings cuantizados o de menos dimensiones lo reducen.

¿Qué tamaño de fragmento debo usar?

Muchos sistemas usan unos cientos de tokens por fragmento. Los fragmentos más pequeños dan una recuperación más precisa pero más vectores; los más grandes llevan más contexto a cada respuesta, lo que sube el coste de generación.

¿Incluye esto el reordenamiento o el alojamiento?

No. Añade por separado las llamadas de API de reordenamiento, el alojamiento de la aplicación y la monitorización. La calculadora de almacenamiento de bases de datos vectoriales ofrece una estimación de almacenamiento más detallada.