Totemize
  • Rutas totémicas
  • Precios
  • Quiénes somos
Iniciar sesiónÚnete gratis
Únete gratis
Ctrl+K
Modelo mental
  • Base de conocimiento
  • Cloud
    • Azure
      • Web Apps
        • App Service
        • App Service Plan
        • Configuración
        • Managed Identity
        • Deployment Slots
        • Networking
        • Observabilidad
      • Storage Accounts
        • Blob Storage
        • Containers
        • Azure Files
        • Queue Storage
        • Table Storage
        • Redundancia
        • Access Tiers
        • Lifecycle Management
        • Seguridad y red
  • Frontend
    • React
      • Componentes
      • Props y Estado
      • Hooks
      • Renderizado de listas
  • IA
    • Fundamentos
      • Determinismo y probabilismo
      • LLM
      • Proveedor
      • Modelos fundacionales
      • Plataforma
      • Mapa del ecosistema
      • Entrenamiento y fine-tuning
      • Tokens
      • Ventana de contexto
      • Inferencia y sampling
      • Alucinaciones y límites
    • Interacción con el modelo
      • Prompts e instrucciones
      • Context engineering
      • Salidas estructuradas
      • Validación
      • Evaluaciones
      • Tool calling
    • Economía de uso
      • API pricing
      • Tokens de entrada y salida
      • Tokens en caché
      • Créditos
      • Suscripciones
      • Límites de uso
      • Selección de modelo
    • Recuperación de conocimiento
      • Vectores
      • Embeddings
      • Chunking
      • Bases de datos vectoriales
      • Búsqueda semántica
      • Búsqueda híbrida y reranking
      • Retrieval
      • RAG
      • Citas y grounding
      • LlamaIndex
    • Agentes
      • Workflows
      • Anatomía de un agente
      • Harness
      • Agentic loop
      • Planificación y human-in-the-loop
      • Memory
      • Permisos
      • Verification
      • MCP
      • Orquestación
      • Multiagentes
      • A2A
      • Frameworks de agentes
        • Microsoft Agent Framework
        • OpenAI Agents SDK
        • Google ADK
        • LangGraph
    • Coding agents
      • Skills
      • Spec-Driven Development
      • Claude Code
        • CLAUDE.md
        • Commands
        • Hooks
        • Plugins
        • Permisos
        • Subagents
      • Codex
        • CLI
        • Extensión de IDE
        • Codex app
        • Cloud
        • AGENTS.md
        • Worktrees
      • Cursor
        • Agent mode
        • Rules
        • Models
        • Precio por uso
  • Soporte
  • Comentarios
  1. IA
  2. Economia
Árbol de habilidades

API pricing

1 min de lecturaActualizado el 9 jul 2026

Cuando usas un LLM por API, el modelo de cobro es casi universal: pagas por token procesado, normalmente expresado en precio por millón de tokens (por ejemplo, “$3 / 1M input, $15 / 1M output”). No hay cuota mínima: pagas lo que consumes.

Las variables que mueven la factura

  1. Qué modelo usas. Un modelo grande y capaz cuesta bastante más por token que uno pequeño y rápido. Elegir el modelo adecuado por tarea es la palanca de coste número uno.
  2. Entrada vs. salida. Se cobran a precios distintos; la salida suele ser 3–5× más cara.
  3. Cuántos tokens. Y aquí está la trampa: en una conversación, cada turno reenvía todo el historial como entrada, así que el coste crece con la longitud acumulada.
  4. Caché. Reutilizar contexto repetido puede recortar el input de forma notable.

Cómo estimar antes de construir

coste ≈ (tokens_input / 1M) × precio_input + (tokens_output / 1M) × precio_output

Multiplica por el número de llamadas esperadas. Para un chat con historial, recuerda sumar el historial acumulado en el input de cada turno, no solo el último mensaje.

Cuándo el pago por API es lo correcto

  • Cargas variables o impredecibles: pagas exactamente lo que usas.
  • Integrar IA dentro de tu propio producto (no consumo humano interactivo).
  • Necesitas control fino de modelo, parámetros y versión.

Cuándo NO

  • Uso personal intenso e interactivo: ahí suele ganar una suscripción de tarifa plana.
  • Equipos que quieren coste predecible por cabeza.

Errores comunes

  • Estimar con el modelo más caro “por si acaso”: prueba si uno menor cumple la tarea.
  • Olvidar el historial acumulado al proyectar el coste de un chat.
  • No poner alertas de gasto: el pago por uso no tiene techo salvo el que le pongas.

Temas relacionados

Se cobra en tokens, distingue entrada/salida y se abarata con caché. La alternativa es la suscripción.