El fine-tuning enseña a un modelo existente tu formato, tu tono o tu tarea a partir de ejemplos. Los proveedores cobran por los tokens procesados en el entrenamiento, multiplicados por el número de épocas, y después cobran por token por usar el modelo ajustado. La factura del entrenamiento suele ser menor de lo que la gente teme; el coste de uso y el número de experimentos son donde se desvían los presupuestos.
Cómo funciona
Tokens de entrenamiento = ejemplos × tokens medios por ejemplo × épocas. 5.000 ejemplos de 800 tokens son un conjunto de datos de 4 millones de tokens; con tres épocas se entrenan 12 millones de tokens.
Coste de entrenamiento por ejecución = tokens entrenados ÷ 1.000.000 × el precio por millón. La mayoría de los proyectos necesita varias ejecuciones para acertar con los datos y los ajustes, así que la calculadora multiplica por el número de ejecuciones que esperas.
Usar el modelo ajustado se cobra por solicitud, como cualquier llamada a una API: tokens de entrada × precio de entrada más tokens de salida × precio de salida. Los modelos ajustados suelen tener un precio mayor que sus modelos base, así que compara esta cifra mensual con usar simplemente un modelo base más grande con un buen prompt.
Los precios por defecto son ejemplos para mostrar la aritmética, no presupuestos. Los precios del fine-tuning varían mucho entre proveedores y modelos base, así que introduce las cifras actuales de la página de precios del proveedor.
Un ejemplo resuelto
Haces fine-tuning con 5.000 ejemplos de 800 tokens de media durante 3 épocas, lo que entrena 12 millones de tokens por ejecución. A 25 $ por millón son 300 $ por ejecución, o 900 $ por tres ejecuciones. Atender 100.000 solicitudes al mes con 600 tokens de entrada y 250 de salida, con precios del modelo ajustado de 3,75 $ y 15 $ por millón, cuesta 600 $ al mes, así que el primer año suma 8.100 $.
Más ejemplos
El entrenamiento suele ser la parte pequeña. Con 1 millón de solicitudes al mes, la inferencia del modelo ajustado cuesta 6.000 $ al mes, y el primer año unos 72.900 $, frente a 900 $ de entrenamiento.
Errores frecuentes
- Presupuestar solo el entrenamiento y olvidar los precios de inferencia más altos de los modelos ajustados.
- Hacer un solo experimento cuando normalmente hacen falta varios.
- Hacer fine-tuning antes de probar mejores prompts o la recuperación.
- Ignorar el coste de preparar y limpiar los datos de entrenamiento.
Preguntas frecuentes
¿Cuánto cuesta hacer fine-tuning de un LLM?
Multiplica los tokens de tu conjunto de datos por el número de épocas y por el precio de entrenamiento del proveedor por millón de tokens. Los conjuntos pequeños pueden costar unos pocos dólares por ejecución; los grandes, cientos o más. Después suma el coste de usar el modelo ajustado, que suele ser la cifra mayor a lo largo de un año.
¿Cuántos ejemplos de entrenamiento necesito?
Los proveedores suelen sugerir empezar con unas pocas docenas o unos pocos cientos de ejemplos de alta calidad y añadir más si los resultados mejoran. La calidad y la coherencia importan más que el volumen: 500 ejemplos limpios a menudo superan a 5.000 con ruido.
¿Qué es una época en el fine-tuning?
Una pasada completa sobre los datos de entrenamiento. Tres épocas significan que cada ejemplo se ve tres veces y pagas tres veces los tokens del conjunto de datos. Demasiadas épocas pueden hacer que el modelo memorice los ejemplos en lugar de aprender el patrón.
¿Es el fine-tuning más barato que la ingeniería de prompts?
A veces. Un modelo ajustado puede usar un prompt mucho más corto, lo que reduce los tokens de entrada en cada solicitud. Si tu prompt actual es largo y tu volumen es alto, ese ahorro puede superar el coste del entrenamiento y el mayor precio por token.
¿Debo hacer fine-tuning o usar RAG?
El fine-tuning cambia cómo se comporta un modelo: formato, tono, una tarea concreta. La recuperación (RAG) le da datos que no conocía. Si el problema es un conocimiento que falta o que cambia, usa RAG. Si es de estilo o coherencia, el fine-tuning encaja.