Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Economia
Árbol de habilidades

Selección de modelo

1 min de lecturaActualizado el 9 jul 2026

Seleccionar un modelo no es elegir al ganador de un benchmark general. Es encontrar la opción que cumple tu tarea con el mejor equilibrio entre calidad, costo, latencia, privacidad y operación.

Empieza por la tarea

Separa el trabajo en clases concretas:

  • extracción o clasificación con schema;
  • generación breve;
  • razonamiento complejo;
  • código y uso de herramientas;
  • procesamiento multimodal;
  • embeddings o reranking.

Una aplicación rara vez necesita el mismo modelo para todo. La tarea define qué capacidades debes evaluar y qué fallos importan.

La matriz de decisión

DimensiónPregunta
Calidad¿pasa el golden set y los casos críticos?
Costo¿cuánto cuesta el flujo completo, incluidos reintentos y contexto?
Latencia¿cumple p50 y p95 bajo carga?
Contexto¿cabe la entrada útil sin degradar atención ni factura?
Capacidades¿soporta tools, schemas y modalidades necesarias?
Privacidad¿cumple residencia, retención y acceso?
Operación¿hay cuotas, SLA, observabilidad y ciclo de versión adecuados?

Mide costo por tarea exitosa, no sólo precio por millón de tokens. Un modelo barato que necesita tres reintentos puede salir más caro que uno mejor en la primera llamada.

Routing por dificultad

Un patrón eficaz es empezar con un modelo pequeño y escalar cuando:

  • el validador rechaza la salida;
  • la entrada pertenece a una categoría compleja;
  • falta confianza o evidencia;
  • el impacto exige una segunda revisión.

El routing también añade complejidad: más rutas que evaluar, observar y mantener. Úsalo cuando el ahorro o la calidad justifiquen esa superficie.

Proceso reproducible

  1. define dataset y métricas;
  2. establece un baseline;
  3. compara candidatos con el mismo contexto y contrato;
  4. mide calidad, costo total y latencia;
  5. prueba fallos, cuotas y fallback;
  6. despliega de forma gradual y conserva rollback;
  7. repite al cambiar modelo, versión, prompt o retrieval.

[!TIP] El mejor modelo es el más pequeño y operable que supera el umbral de calidad de la tarea, no el más capaz del catálogo.

Temas relacionados

Necesitas Evaluaciones para comparar, API pricing para estimar y Proveedor para valorar gobierno y portabilidad.