Inferencia es ejecutar un modelo ya entrenado. En un LLM, cada paso calcula puntuaciones para los posibles siguientes tokens, las convierte en probabilidades y elige uno. Sampling es la política usada para elegir dentro de esa distribución.
contexto → puntuaciones → probabilidades → token elegido
↘ repetir hasta terminar| Control | Qué cambia | Riesgo al exagerarlo |
|---|---|---|
| Temperatura | aplana o concentra la distribución | incoherencia o respuestas rígidas |
| Top-p | limita la elección a una masa de probabilidad | elimina alternativas útiles |
| Máximo de salida | tope de tokens generados | respuesta truncada |
| Stop conditions | secuencias o eventos que terminan | corte prematuro |
| Seed, si existe | ayuda a repetir el muestreo | no garantiza identidad total |
Temperatura baja favorece los tokens más probables; una alta permite más variedad. Top-p recorta la cola de opciones improbables. Normalmente ajustas uno con intención y dejas el otro en un valor estable, en vez de mover ambos sin una evaluación.
Los modelos de razonamiento o algunas APIs pueden administrar parte de estos controles por su cuenta. No asumas que todos los parámetros existen o significan exactamente lo mismo en cada modelo y plataforma.
Temperatura cero reduce variación, pero versión del modelo, contexto, backend y detalles numéricos todavía pueden cambiar el resultado. Si necesitas un contrato estable:
El sampling materializa el probabilismo del LLM. El siguiente límite práctico son las Alucinaciones y límites.