Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Interaccion
Árbol de habilidades

Evaluaciones

1 min de lecturaActualizado el 9 jul 2026

Una evaluación comprueba si un sistema con LLM cumple una tarea en un conjunto de casos. Es la disciplina que sustituye «en mi demo se veía bien» por evidencia repetible. Debe medir el sistema completo: modelo, instrucciones, contexto, retrieval, herramientas y validadores.

Empieza por el contrato

Antes de elegir una métrica, define:

  • qué entrada representa uso real;
  • qué salida es aceptable;
  • qué errores son tolerables y cuáles son críticos;
  • qué dimensiones importan: exactitud, groundedness, formato, costo o latencia;
  • quién decide los casos ambiguos.

Después construye un golden set pequeño pero representativo. Incluye casos normales, límites, entradas adversariales y fallos que ya ocurrieron en producción.

Una pirámide de evaluadores

  1. Checks determinísticos: schema, coincidencia exacta, compilación, tests, IDs válidos. Son baratos y claros.
  2. Métricas específicas: precision, recall, relevancia de retrieval, similitud o reglas del dominio.
  3. LLM-as-judge: útil para criterios cualitativos con una rúbrica concreta, pero también es probabilístico y puede tener sesgos.
  4. Revisión humana: necesaria para calibrar jueces, resolver ambigüedad y evaluar riesgos de alto impacto.

Combina capas. No uses un juez de lenguaje para algo que una función puede comprobar sin ambigüedad.

Cómo ejecutar una regresión

  • fija dataset, versión de prompt, modelo y parámetros;
  • repite casos sensibles para capturar variabilidad;
  • compara contra el baseline, no sólo contra un umbral aislado;
  • guarda ejemplos de fallos, costo y latencia;
  • bloquea el cambio si empeora una dimensión crítica;
  • revisa el dataset cuando cambie el tráfico real.

Una media puede ocultar un desastre en una categoría. Segmenta por idioma, longitud, dominio y tipo de usuario.

Offline y online

Las evaluaciones offline permiten experimentar antes del despliegue. En producción observa rechazos, correcciones humanas, abstenciones, reintentos, latencia y costo. No envíes datos sensibles a un evaluador sin la misma gobernanza que aplicas al modelo principal.

Temas relacionados

La evaluación mide el probabilismo, los validadores aportan señales objetivas y la Selección de modelo usa esos resultados para decidir.