¿Qué hace único al Nivel 5?
En todos los niveles anteriores (0-4), Claude responde cuando tú lo llamas. En el Nivel 5, Claude toma la iniciativa: lee archivos sin que se los pidas, ejecuta comandos según su criterio, itera sobre errores, y solo te reporta cuando hay algo que requiere tu decisión. Es la diferencia entre un empleado que espera instrucciones y un profesional autónomo que gestiona un proyecto.
Las dos analogías que capturan la esencia
El cirujano en operación
No interrumpes al cirujano a mitad de la operación para preguntarle "¿estás seguro?". Recibió el diagnóstico (tarea), tiene el instrumental (herramientas), aplica su juicio en tiempo real (el loop). Solo llama a un especialista si encuentra algo inesperado.
Lo que captura: La autonomía NO es falta de control — es el control correcto en el momento correcto. Los límites (permisos) están pre-establecidos, no se preguntan en cada incisión.
El piloto automático
Recibe destino + altitud (el prompt). Lee instrumentos (tools), ajusta controles (ediciones), evalúa turbulencia (errores), y solo alerta al piloto humano si excede sus parámetros de operación. No te pregunta "¿corrijo a la izquierda?" en cada maniobra.
Lo que captura: El loop autónomo como mecanismo de feedback continuo. Leer → decidir → actuar → evaluar → repetir.
La línea que separa los niveles
| Nivel | Qué hace Claude | Quién controla el flujo | Herramientas |
|---|---|---|---|
| 0 — Prompt | Responde una vez | El usuario | Ninguna |
| 1 — CLAUDE.md | Responde con contexto persistente | El usuario | Ninguna |
| 2 — Skill | Sigue instrucciones cargadas | El usuario invoca | Las que el skill permite |
| 5 — Agente ← | Ejecuta autónomamente en loop | Claude decide | Todas las disponibles |
La línea exacta: Un agente existe cuando Claude tiene un loop de ejecución con herramientas y toma decisiones sin intervención humana entre pasos. Si Claude necesita que el usuario confirme cada paso, es un skill asistido — no un agente. A
Agentes en producción — 2026
📄 Lo que dice el paper de MIT (ArXiv 2604.14228, abril 2026)
"El núcleo de Claude Code es sorprendentemente simple — un while-loop que llama al modelo, ejecuta tools, y repite. La complejidad real vive en los sistemas alrededor del loop: sistema de permisos con 7 modos y clasificador ML, pipeline de compactación de contexto en 5 capas, y 4 mecanismos de extensibilidad."
El Agentic Loop — Arquitectura interna
Todo agente, sin excepción, es una instancia de este loop. La diferencia entre agentes simples y complejos es lo que ocurre dentro de cada step, no la estructura del loop en sí. A — ArXiv 2604.14228
Ciclo completo de un turn
while task_not_complete and within_limits: reasoning = model.think(context + history + tool_results) tool_calls = reasoning.decide_tools() tool_results = execute_tools(tool_calls) # parallel/sequential context.append(tool_results) if reasoning.task_complete(): break if reasoning.needs_human(): human_input = ask_user() context.append(human_input)
Controles del loop
Parámetros de control
| Control | Default | Descripción |
|---|---|---|
max_turns | Sin límite | Máximo de turns del agente |
max_budget_usd | Sin límite | Presupuesto máximo en USD |
effort | Varía | Profundidad de razonamiento |
Subtipos de resultado
| Subtipo | Significado |
|---|---|
success | Completado |
error_max_turns | Límite de turns |
error_max_budget_usd | Presupuesto agotado |
error_during_execution | Error en ejecución |
Los 5 valores que guían el diseño (MIT ArXiv 2604.14228)
Herramientas built-in del agente
Agent SDK y Sistema de Permisos
El Agent SDK es la biblioteca oficial para construir agentes programáticamente. El sistema de permisos es lo que diferencia un agente seguro de uno riesgoso. A
Instalación y ejemplo básico
# Python pip install claude-agent-sdk # TypeScript npm install @anthropic-ai/claude-agent-sdk
import asyncio from claude_agent_sdk import query, ClaudeAgentOptions async def main(): async for message in query( prompt="Encuentra y corrige el bug en auth.py", options=ClaudeAgentOptions( allowed_tools=["Read", "Edit", "Bash"], max_turns=30, effort="high", max_budget_usd=3.0, # máximo $3 por ejecución ), ): print(message) asyncio.run(main())
4 providers de autenticación
ANTHROPIC_API_KEYDesarrollo y producción estándar
CLAUDE_CODE_USE_BEDROCK=1Empresas reguladas con datos en AWS
CLAUDE_CODE_USE_VERTEX=1Empresas con datos en GCP
CLAUDE_CODE_USE_FOUNDRY=1Empresas con datos en Azure
Sistema de permisos — 6 modos
Los permisos son el "contrato de autonomía" entre el humano y el agente. Configurarlos mal en exceso es como dar a un cirujano junior permiso para operar sin supervisión. Configurarlos muy restrictivos es como preguntarle al piloto automático si está seguro de cada maniobra de rutina.
| Modo | Comportamiento | Riesgo | Cuándo usarlo |
|---|---|---|---|
default | Pide permiso para operaciones peligrosas | Bajo | Desarrollo interactivo |
plan | Solo planifica, no ejecuta nada | Ninguno | Revisar antes de ejecutar |
acceptEdits | Auto-aprueba ediciones de archivos | Medio | CI/CD controlado |
dontAsk | Nunca pregunta, omite acciones restringidas | Medio | Workflows batch |
auto | Auto-aprueba todo | Alto | Testing automatizado |
bypassPermissions | Sin restricciones — ejecuta cualquier cosa | Muy alto | NUNCA en producción |
Human-in-the-loop — 3 mecanismos
Subagentes — Delegación de subtareas
Un subagente es una instancia separada lanzada por el agente principal. Tiene su propio contexto aislado — no hereda el historial del padre. Es el mecanismo que permite paralelismo real dentro de un agente. A
Un director de proyecto (agente padre) no hace todo él solo — delega a especialistas (subagentes). El especialista en seguridad revisa los endpoints. El de performance analiza las queries. El director consolida los resultados. Cada especialista trabaja en su propia "sala" (contexto aislado) sin ver las notas del director ni las de los otros especialistas.
3 formas de crear subagentes
Via parámetro agents en query(). Máximo control: defines description, prompt, tools, modelo y límites de cada subagente.
Archivos markdown en .claude/agents/ que Claude descubre automáticamente. Más simple que la programática.
Claude lanza subagentes sin que definas nada — usa su agente general. Útil para paralelismo ad-hoc en tareas grandes.
Qué hereda y qué NO hereda un subagente
- → Su propio system prompt (definido en AgentDefinition)
- → El prompt del tool Agent (la tarea específica)
- → CLAUDE.md del proyecto
- → Definiciones de sus propias herramientas
- → Historial de conversación del padre
- → Resultados de tools del padre
- → System prompt del padre
- → Skills pre-cargados del padre
Los subagentes NO pueden lanzar sus propios subagentes. No incluir Agent en el array de tools de un subagente. Solo un nivel de profundidad. Para coordinar múltiples niveles → Multi-agente (Nivel 6). A
Ejemplo con subagentes especializados
from claude_agent_sdk import AgentDefinition, query, ClaudeAgentOptions agents = { "security-reviewer": AgentDefinition( description="Especialista en code review de seguridad. Usar para" " revisar endpoints, auth, y datos sensibles.", prompt="Eres experto en seguridad web. Analiza: inyección SQL," " XSS, CSRF, credenciales inseguras. Proporciona fixes.", tools=["Read", "Grep", "Glob"], # solo lectura — más seguro model="claude-opus-4", effort="high", ), "test-writer": AgentDefinition( description="Genera tests unitarios y de integración.", prompt="Genera tests exhaustivos con casos edge y mocks.", tools=["Read", "Write", "Bash"], model="claude-sonnet-4", ), } async for msg in query( prompt="Revisa auth.py por seguridad y genera tests", options=ClaudeAgentOptions(agents=agents, max_budget_usd=3.0), ): print(msg)
Agent View — gestión paralela desde terminal
claude agents abre una UI de terminal para despachar y gestionar múltiples sesiones simultáneas. Las sesiones background usan git worktrees. A
# Lanzar agentes en background claude --bg "refactorizar módulo de auth" claude --agent security-reviewer --bg "revisar PR #247" claude --bg --name "fix-auth" "corregir bug en api/users.ts"
Claude Managed Agents — Lanzado el 8 de abril 2026
El primer intento serio de un proveedor de modelos frontier por poseer la capa de infraestructura para ejecución de agentes. Tú escribes la lógica del agente, Anthropic lo ejecuta en containers seguros. A
Usar el Agent SDK en tu servidor es cocinar en casa: control total, pero también responsabilidad de higiene, equipamiento y seguridad. Managed Agents es contratar la cocina industrial de un restaurante con certificaciones de salud: el chef solo se enfoca en la receta, el establecimiento maneja el entorno.
Qué incluye la infraestructura
gVisor containers
El mismo sandbox de kernel que usa Kubernetes. Cada agente corre completamente aislado.
Egress default-deny
Tráfico de red bloqueado por default. Solo dominios explícitamente allowlisteados pueden recibir llamadas.
Scoped access
/workspace (lectura/escritura) y /source (solo lectura). Sin acceso al host.
Sin límite de duración
El proceso sobrevive desconexiones del cliente. Ideal para tareas largas overnight.
Trazas y logs
Trazas, logs y métricas incluidos por default. Sin configuración adicional.
Tokens + $0.08/session-hr
Precio estándar de tokens de Claude + $0.08 por hora de sesión activa.
SDK vs API vs Managed Agents
| Aspecto | Agent SDK | API Client | Managed Agents |
|---|---|---|---|
| Loop | Automático | Tú lo implementas | Hosted por Anthropic |
| Herramientas | Built-in incluidas | Solo interfaz | Sandbox incluido |
| Infraestructura | Tu servidor | Tu servidor | Anthropic lo corre |
| Aislamiento | Tu responsabilidad | Tu responsabilidad | gVisor (automático) |
| Sesiones largas | Tu responsabilidad | Tu responsabilidad | Nativo |
| Precio adicional | Solo tokens | Solo tokens | +$0.08/session-hora |
Early adopters reportando resultados
Notion permite que sus usuarios deleguen coding, slides y spreadsheets a Claude sin salir de su workspace. Docenas de tareas paralelas corriendo simultáneamente, cada una en su propio agente aislado. A
Desplegaron agentes especialistas para: producto, ventas, marketing, finanzas y HR. Cada uno en producción en menos de 1 semana desde el inicio del desarrollo. A
Construyeron "AI Teammates" que toman tareas asignadas dentro de proyectos de Asana. El CTO reportó que shippearon features "dramatically faster" — sin dar un número específico. A
El agente más autónomo documentado: Sentry detecta error → Claude lee el stack trace → navega el codebase → identifica el fix → abre PR con descripción y tests → notifica al equipo. Sin intervención humana en ningún step.
Es uno de los primeros agentes de producción con ciclo de valor completamente autónomo en software: detección → diagnóstico → fix → PR. El piloto automático del desarrollo. A
Casos Reales en Producción
Resultados documentados por Anthropic o reportados directamente por las empresas. Los ratios de mejora son indicativos, no garantías reproducibles en cualquier contexto.
Caso destacado: Migración de 10,000 líneas Scala→Java en 4 días (estimado: 10 semanas de ingeniero).
Proceso de rollout: 2-3 meses de testing con Anthropic para producir un binary enterprise firmado sin dependencias npm externas. Distribución como binary único en toda la organización.
Por qué funcionó como agente: La migración Scala→Java es una tarea de transformación sistemática que requiere decisiones contextuales en cada archivo — no es predecible con scripts. El agente lee el contexto de cada clase, decide el patrón de conversión correcto, y verifica que los tests pasen.
A — Anthropic customer story
Migración: 50,000 líneas Python→Go en ~20 horas de desarrollo activo (estimado manual: 2-3 meses).
Técnica: Múltiples agentes paralelos con git worktrees — cada agente trabaja en un módulo diferente sin conflictos de merge. El mismo patrón que usa el Agent View de Claude Code.
Por qué swarm y no agente individual: 50K líneas excede una ventana de contexto. Los módulos son relativamente independientes — ideal para paralelismo.
A — Anthropic customer story
Problema: Correlacionar miles de transacciones para investigar incidentes financieros requería horas de trabajo manual de múltiples analistas.
Solución: Agentes via SDK con acceso a logs, código y documentación via MCP. El agente puede cargar miles de registros en un solo contexto — algo imposible para un humano en el mismo tiempo.
Resultado: 80% de reducción en tiempo de investigación por incidente.
A — Anthropic customer story
Alcance: Desde julio 2025, Anthropic desplegó Claude en producción en los principales bancos de Wall Street. 70% del Fortune 100 usando Claude.
Usos de agentes en finanzas: Análisis de crédito (correlación de transacciones para scoring), detección de anomalías en tiempo real, generación de reportes regulatorios de compliance.
Desarrollo de 2026: En mayo 2026, Anthropic anunció una suite de agentes pre-construidos para servicios financieros con Claude Opus 4.7 como modelo de alta precisión para trabajo financiero.
A — Fortune, mayo 2026
¿Necesito un agente?
El while-loop tiene un costo — úsalo cuando el beneficio lo justifica. La sobreingeniería con agentes donde un prompt es suficiente es el error más común.
Árbol de decisión completo
Tipos de agentes — cuándo usar cada uno
| Tipo | Autonomía | Modo permiso | Cuándo usarlo |
|---|---|---|---|
| Asistido | Baja | default | Code review con aprobación humana |
| Semi-autónomo | Media | acceptEdits | Refactoring con budget definido |
| Autónomo | Alta | auto | Background agent en CI/CD |
| Subagente especializado | Media-Alta | Hereda del padre | Subtareas paralelas con expertise específico |
Cuándo escalar a multi-agente
La tarea excede ~200K tokens de contexto. Un agente individual no puede mantener todo el estado relevante. → Swarm o Pipeline (Nivel 6)
La tarea requiere múltiples dominios de expertise simultáneos — seguridad + performance + UX al mismo tiempo. → Supervisor/Worker (Nivel 6)
Necesitas operación 24/7 con monitoreo, recuperación de fallos y coordinación entre departamentos. → Sistema de agentes (Nivel 7)