Una evaluación comprueba si un sistema con LLM cumple una tarea en un conjunto de casos. Es la disciplina que sustituye «en mi demo se veía bien» por evidencia repetible. Debe medir el sistema completo: modelo, instrucciones, contexto, retrieval, herramientas y validadores.
Antes de elegir una métrica, define:
Después construye un golden set pequeño pero representativo. Incluye casos normales, límites, entradas adversariales y fallos que ya ocurrieron en producción.
Combina capas. No uses un juez de lenguaje para algo que una función puede comprobar sin ambigüedad.
Una media puede ocultar un desastre en una categoría. Segmenta por idioma, longitud, dominio y tipo de usuario.
Las evaluaciones offline permiten experimentar antes del despliegue. En producción observa rechazos, correcciones humanas, abstenciones, reintentos, latencia y costo. No envíes datos sensibles a un evaluador sin la misma gobernanza que aplicas al modelo principal.
La evaluación mide el probabilismo, los validadores aportan señales objetivas y la Selección de modelo usa esos resultados para decidir.