Toda llamada a un LLM tiene dos contadores de tokens que se cobran por separado:
La salida suele valer 3 a 5 veces más por token que la entrada. La razón es técnica: la entrada se procesa de golpe en paralelo, mientras que la salida se genera token a token, cada uno dependiendo del anterior. Eso consume más cómputo secuencial y es más caro de servir.
Consecuencia práctica: pedir respuestas más cortas ahorra más que acortar el prompt.
| Palanca | Efecto |
|---|---|
| Respuestas más breves | Recorta el output caro |
| Resumir el historial | Recorta el input acumulado |
| RAG en vez de pegar todo | Menos input por turno |
| Caché de prompt | Input repetido más barato |
| Modelo menor donde alcance | Baja el precio por token de ambos |
Es el detalle fino del API pricing; se mitiga con tokens en caché y buena context engineering.