En cuanto un agente puede actuar —editar archivos, correr comandos, llamar APIs— aparece la pregunta que define su seguridad: ¿qué puede hacer solo y qué requiere tu aprobación? Ese es el sistema de permisos, y es responsabilidad del harness, no del modelo.
El modelo solo predice texto: puede equivocarse, alucinar un comando destructivo, o ser manipulado por contenido malicioso (prompt injection) que encuentre en un archivo o una web. Si cada acción que pide se ejecutara sin control, un error del modelo sería un error en tu sistema. Los permisos son la barrera entre “pedir” y “hacer”.
git status) y cuáles siempre preguntan (p. ej. rm, push).Demasiada aprobación y el agente es un chat glorificado que te interrumpe siempre. Demasiada autonomía sin sandbox y le das las llaves de tu máquina. El punto sano:
push, desplegar, mandar datos fuera):
aprobación explícita.Cada coding agent implementa esto a su manera: los permisos de Claude Code, las aprobaciones y sandbox de Codex, los modos de Cursor. El concepto es el mismo; cambia el mando.
Gobiernan las tools que el harness ejecuta, y se complementan con la verificación posterior.