Módulo 03 · Arquitectura · Nivel 5 del Ecosistema

🤖 Agentes — Ejecución autónoma

El agentic loop, SDK, subagentes, Managed Agents y casos reales de JPMorgan, Stripe, Sentry
← Volver al Dashboard

¿Qué hace único al Nivel 5?

En todos los niveles anteriores (0-4), Claude responde cuando tú lo llamas. En el Nivel 5, Claude toma la iniciativa: lee archivos sin que se los pidas, ejecuta comandos según su criterio, itera sobre errores, y solo te reporta cuando hay algo que requiere tu decisión. Es la diferencia entre un empleado que espera instrucciones y un profesional autónomo que gestiona un proyecto.

Las dos analogías que capturan la esencia

🏥

El cirujano en operación

Analogía

No interrumpes al cirujano a mitad de la operación para preguntarle "¿estás seguro?". Recibió el diagnóstico (tarea), tiene el instrumental (herramientas), aplica su juicio en tiempo real (el loop). Solo llama a un especialista si encuentra algo inesperado.

Lo que captura: La autonomía NO es falta de control — es el control correcto en el momento correcto. Los límites (permisos) están pre-establecidos, no se preguntan en cada incisión.

✈️

El piloto automático

Analogía

Recibe destino + altitud (el prompt). Lee instrumentos (tools), ajusta controles (ediciones), evalúa turbulencia (errores), y solo alerta al piloto humano si excede sus parámetros de operación. No te pregunta "¿corrijo a la izquierda?" en cada maniobra.

Lo que captura: El loop autónomo como mecanismo de feedback continuo. Leer → decidir → actuar → evaluar → repetir.

La línea que separa los niveles

NivelQué hace ClaudeQuién controla el flujoHerramientas
0 — PromptResponde una vezEl usuarioNinguna
1 — CLAUDE.mdResponde con contexto persistenteEl usuarioNinguna
2 — SkillSigue instrucciones cargadasEl usuario invocaLas que el skill permite
5 — Agente ←Ejecuta autónomamente en loopClaude decideTodas las disponibles

La línea exacta: Un agente existe cuando Claude tiene un loop de ejecución con herramientas y toma decisiones sin intervención humana entre pasos. Si Claude necesita que el usuario confirme cada paso, es un skill asistido — no un agente. A

Agentes en producción — 2026

70% Fortune 100 usando Claude en producción A
1,370 Ingenieros de Stripe usando Claude Code A
80% Reducción en tiempo de investigación — Ramp A
$0.08 Precio por session-hora en Managed Agents A

📄 Lo que dice el paper de MIT (ArXiv 2604.14228, abril 2026)

"El núcleo de Claude Code es sorprendentemente simple — un while-loop que llama al modelo, ejecuta tools, y repite. La complejidad real vive en los sistemas alrededor del loop: sistema de permisos con 7 modos y clasificador ML, pipeline de compactación de contexto en 5 capas, y 4 mecanismos de extensibilidad."

A — ArXiv 2604.14228, MIT, abril 2026

El Agentic Loop — Arquitectura interna

Todo agente, sin excepción, es una instancia de este loop. La diferencia entre agentes simples y complejos es lo que ocurre dentro de cada step, no la estructura del loop en sí. A — ArXiv 2604.14228

Ciclo completo de un turn

1
Contexto completo → Claude
system_prompt + CLAUDE.md + definiciones de tools + historial + resultados de tools anteriores. Claude ve todo antes de razonar.
2
Claude razona y genera
Produce: texto narrativo + llamadas a herramientas (tool_calls). Decide qué herramientas usar, con qué parámetros, en qué orden.
3
El SDK ejecuta las herramientas
Lectura (Read, Grep, Glob, WebSearch): concurrente — se ejecutan en paralelo. Escritura (Edit, Write, Bash): secuencial — una a la vez para evitar conflictos.
4
Resultados añadidos al historial
Los tool_results entran al contexto. Claude los verá en el siguiente turn. El historial crece hasta la compactación.
5
Evaluar: ¿Continuar o parar?
Si tarea_completa → retorna resultado final. Si necesita_humano → llama AskUserQuestion. Si dentro_de_límites → vuelve al step 1.
while task_not_complete and within_limits:
    reasoning = model.think(context + history + tool_results)
    tool_calls = reasoning.decide_tools()
    tool_results = execute_tools(tool_calls)  # parallel/sequential
    context.append(tool_results)
    if reasoning.task_complete():
        break
    if reasoning.needs_human():
        human_input = ask_user()
        context.append(human_input)

Controles del loop

Parámetros de control

ControlDefaultDescripción
max_turnsSin límiteMáximo de turns del agente
max_budget_usdSin límitePresupuesto máximo en USD
effortVaríaProfundidad de razonamiento

Subtipos de resultado

SubtipoSignificado
successCompletado
error_max_turnsLímite de turns
error_max_budget_usdPresupuesto agotado
error_during_executionError en ejecución

Los 5 valores que guían el diseño (MIT ArXiv 2604.14228)

1. Autoridad humana
→ Sistema de permisos en 7 modos
2. Seguridad
→ Clasificador ML evalúa cada tool
3. Ejecución confiable
→ Pipeline de compactación 5 capas
4. Amplificación
→ 4 mecanismos: MCP, plugins, skills, hooks
5. Adaptabilidad
→ Cambio de modelo y esfuerzo mid-session
A — ArXiv 2604.14228, abril 2026

Herramientas built-in del agente

📖
Read
Leer archivos del directorio
Lectura · Concurrente
🔍
Glob
Buscar archivos por patrón
Lectura · Concurrente
🔎
Grep
Buscar contenido con regex
Lectura · Concurrente
🌐
WebSearch
Buscar en la web
Lectura · Concurrente
📡
WebFetch
Parsear contenido web
Lectura · Concurrente
✏️
Edit
Editar archivos existentes
Escritura · Secuencial
📝
Write
Crear archivos nuevos
Escritura · Secuencial
💻
Bash
Ejecutar comandos y scripts
Escritura · Secuencial
AskUserQuestion
Preguntar al usuario con opciones
Human-in-the-loop
🤖
Agent
Lanzar subagentes
Delegación

Agent SDK y Sistema de Permisos

El Agent SDK es la biblioteca oficial para construir agentes programáticamente. El sistema de permisos es lo que diferencia un agente seguro de uno riesgoso. A

Instalación y ejemplo básico

# Python
pip install claude-agent-sdk

# TypeScript
npm install @anthropic-ai/claude-agent-sdk
import asyncio
from claude_agent_sdk import query, ClaudeAgentOptions

async def main():
    async for message in query(
        prompt="Encuentra y corrige el bug en auth.py",
        options=ClaudeAgentOptions(
            allowed_tools=["Read", "Edit", "Bash"],
            max_turns=30,
            effort="high",
            max_budget_usd=3.0,  # máximo $3 por ejecución
        ),
    ):
        print(message)

asyncio.run(main())

4 providers de autenticación

ANTHROPIC DIRECTO
ANTHROPIC_API_KEY

Desarrollo y producción estándar

AMAZON BEDROCK
CLAUDE_CODE_USE_BEDROCK=1

Empresas reguladas con datos en AWS

GOOGLE VERTEX AI
CLAUDE_CODE_USE_VERTEX=1

Empresas con datos en GCP

MICROSOFT AZURE
CLAUDE_CODE_USE_FOUNDRY=1

Empresas con datos en Azure

Sistema de permisos — 6 modos

Por qué los permisos importan

Los permisos son el "contrato de autonomía" entre el humano y el agente. Configurarlos mal en exceso es como dar a un cirujano junior permiso para operar sin supervisión. Configurarlos muy restrictivos es como preguntarle al piloto automático si está seguro de cada maniobra de rutina.

ModoComportamientoRiesgoCuándo usarlo
defaultPide permiso para operaciones peligrosasBajoDesarrollo interactivo
planSolo planifica, no ejecuta nadaNingunoRevisar antes de ejecutar
acceptEditsAuto-aprueba ediciones de archivosMedioCI/CD controlado
dontAskNunca pregunta, omite acciones restringidasMedioWorkflows batch
autoAuto-aprueba todoAltoTesting automatizado
bypassPermissionsSin restricciones — ejecuta cualquier cosaMuy altoNUNCA en producción

Human-in-the-loop — 3 mecanismos

AskUserQuestion
El agente hace preguntas con opciones múltiples cuando necesita decisión humana. El loop se pausa, espera, y continúa con el input.
🔒
Hook PreToolUse
Intercepta antes de ejecutar herramientas. Puede requerir aprobación explícita para operaciones críticas (deploy a producción, enviar email, crear PR).
🛡️
permission_mode: "default"
Claude Code pregunta antes de cada operación que modifica el sistema fuera del workspace. El usuario puede aprobar/rechazar/modificar en tiempo real.

Subagentes — Delegación de subtareas

Un subagente es una instancia separada lanzada por el agente principal. Tiene su propio contexto aislado — no hereda el historial del padre. Es el mecanismo que permite paralelismo real dentro de un agente. A

Analogía

Un director de proyecto (agente padre) no hace todo él solo — delega a especialistas (subagentes). El especialista en seguridad revisa los endpoints. El de performance analiza las queries. El director consolida los resultados. Cada especialista trabaja en su propia "sala" (contexto aislado) sin ver las notas del director ni las de los otros especialistas.

3 formas de crear subagentes

Forma 1 — Programática

Via parámetro agents en query(). Máximo control: defines description, prompt, tools, modelo y límites de cada subagente.

Forma 2 — Sistema de archivos

Archivos markdown en .claude/agents/ que Claude descubre automáticamente. Más simple que la programática.

Forma 3 — General-purpose

Claude lanza subagentes sin que definas nada — usa su agente general. Útil para paralelismo ad-hoc en tareas grandes.

Qué hereda y qué NO hereda un subagente

✅ SÍ recibe
  • → Su propio system prompt (definido en AgentDefinition)
  • → El prompt del tool Agent (la tarea específica)
  • → CLAUDE.md del proyecto
  • → Definiciones de sus propias herramientas
❌ NO recibe
  • → Historial de conversación del padre
  • → Resultados de tools del padre
  • → System prompt del padre
  • → Skills pre-cargados del padre
⚠️ RESTRICCIÓN CRÍTICA

Los subagentes NO pueden lanzar sus propios subagentes. No incluir Agent en el array de tools de un subagente. Solo un nivel de profundidad. Para coordinar múltiples niveles → Multi-agente (Nivel 6). A

Ejemplo con subagentes especializados

from claude_agent_sdk import AgentDefinition, query, ClaudeAgentOptions

agents = {
    "security-reviewer": AgentDefinition(
        description="Especialista en code review de seguridad. Usar para"
                    " revisar endpoints, auth, y datos sensibles.",
        prompt="Eres experto en seguridad web. Analiza: inyección SQL,"
               " XSS, CSRF, credenciales inseguras. Proporciona fixes.",
        tools=["Read", "Grep", "Glob"],  # solo lectura — más seguro
        model="claude-opus-4",
        effort="high",
    ),
    "test-writer": AgentDefinition(
        description="Genera tests unitarios y de integración.",
        prompt="Genera tests exhaustivos con casos edge y mocks.",
        tools=["Read", "Write", "Bash"],
        model="claude-sonnet-4",
    ),
}

async for msg in query(
    prompt="Revisa auth.py por seguridad y genera tests",
    options=ClaudeAgentOptions(agents=agents, max_budget_usd=3.0),
):
    print(msg)

Agent View — gestión paralela desde terminal

claude agents abre una UI de terminal para despachar y gestionar múltiples sesiones simultáneas. Las sesiones background usan git worktrees. A

.claude/ └── worktrees/ ├── fix-auth/ ← sesión 1 — Working 🔄 ├── add-tests/ ← sesión 2 — Working 🔄 └── refactor-api/ ← sesión 3 — Needs input 🟡
# Lanzar agentes en background
claude --bg "refactorizar módulo de auth"
claude --agent security-reviewer --bg "revisar PR #247"
claude --bg --name "fix-auth" "corregir bug en api/users.ts"

Claude Managed Agents — Lanzado el 8 de abril 2026

El primer intento serio de un proveedor de modelos frontier por poseer la capa de infraestructura para ejecución de agentes. Tú escribes la lógica del agente, Anthropic lo ejecuta en containers seguros. A

Analogía — cocina doméstica vs. cocina industrial

Usar el Agent SDK en tu servidor es cocinar en casa: control total, pero también responsabilidad de higiene, equipamiento y seguridad. Managed Agents es contratar la cocina industrial de un restaurante con certificaciones de salud: el chef solo se enfoca en la receta, el establecimiento maneja el entorno.

Qué incluye la infraestructura

Aislamiento

gVisor containers

El mismo sandbox de kernel que usa Kubernetes. Cada agente corre completamente aislado.

Red

Egress default-deny

Tráfico de red bloqueado por default. Solo dominios explícitamente allowlisteados pueden recibir llamadas.

Filesystem

Scoped access

/workspace (lectura/escritura) y /source (solo lectura). Sin acceso al host.

Sesiones

Sin límite de duración

El proceso sobrevive desconexiones del cliente. Ideal para tareas largas overnight.

Observabilidad

Trazas y logs

Trazas, logs y métricas incluidos por default. Sin configuración adicional.

Precio

Tokens + $0.08/session-hr

Precio estándar de tokens de Claude + $0.08 por hora de sesión activa.

SDK vs API vs Managed Agents

AspectoAgent SDKAPI ClientManaged Agents
LoopAutomáticoTú lo implementasHosted por Anthropic
HerramientasBuilt-in incluidasSolo interfazSandbox incluido
InfraestructuraTu servidorTu servidorAnthropic lo corre
AislamientoTu responsabilidadTu responsabilidadgVisor (automático)
Sesiones largasTu responsabilidadTu responsabilidadNativo
Precio adicionalSolo tokensSolo tokens+$0.08/session-hora

Early adopters reportando resultados

Notion
Tareas paralelas sin salir del workspace
Docenas paralelas

Notion permite que sus usuarios deleguen coding, slides y spreadsheets a Claude sin salir de su workspace. Docenas de tareas paralelas corriendo simultáneamente, cada una en su propio agente aislado. A

Rakuten
Agentes especialistas por función de negocio
<1 semana/agente

Desplegaron agentes especialistas para: producto, ventas, marketing, finanzas y HR. Cada uno en producción en menos de 1 semana desde el inicio del desarrollo. A

Asana
AI Teammates que toman tareas asignadas
"Dramatically faster"

Construyeron "AI Teammates" que toman tareas asignadas dentro de proyectos de Asana. El CTO reportó que shippearon features "dramatically faster" — sin dar un número específico. A

Sentry
De bug detectado a PR abierto — completamente autónomo
100% autónomo

El agente más autónomo documentado: Sentry detecta error → Claude lee el stack trace → navega el codebase → identifica el fix → abre PR con descripción y tests → notifica al equipo. Sin intervención humana en ningún step.

Por qué es notable

Es uno de los primeros agentes de producción con ciclo de valor completamente autónomo en software: detección → diagnóstico → fix → PR. El piloto automático del desarrollo. A

Casos Reales en Producción

Resultados documentados por Anthropic o reportados directamente por las empresas. Los ratios de mejora son indicativos, no garantías reproducibles en cualquier contexto.

Stripe — 1,370 ingenieros
Migración Scala→Java · Background agent
12.5x

Caso destacado: Migración de 10,000 líneas Scala→Java en 4 días (estimado: 10 semanas de ingeniero).

Proceso de rollout: 2-3 meses de testing con Anthropic para producir un binary enterprise firmado sin dependencias npm externas. Distribución como binary único en toda la organización.

Por qué funcionó como agente: La migración Scala→Java es una tarea de transformación sistemática que requiere decisiones contextuales en cada archivo — no es predecible con scripts. El agente lee el contexto de cada clase, decide el patrón de conversión correcto, y verifica que los tests pasen.

A — Anthropic customer story

Wiz — Migración masiva con swarm
Python→Go 50K líneas · Agentes paralelos + git worktrees
>50x

Migración: 50,000 líneas Python→Go en ~20 horas de desarrollo activo (estimado manual: 2-3 meses).

Técnica: Múltiples agentes paralelos con git worktrees — cada agente trabaja en un módulo diferente sin conflictos de merge. El mismo patrón que usa el Agent View de Claude Code.

Por qué swarm y no agente individual: 50K líneas excede una ventana de contexto. Los módulos son relativamente independientes — ideal para paralelismo.

A — Anthropic customer story

Ramp — Investigación de incidentes financieros
SDK + MCP · Agente con acceso a logs y código
80%↓ tiempo

Problema: Correlacionar miles de transacciones para investigar incidentes financieros requería horas de trabajo manual de múltiples analistas.

Solución: Agentes via SDK con acceso a logs, código y documentación via MCP. El agente puede cargar miles de registros en un solo contexto — algo imposible para un humano en el mismo tiempo.

Resultado: 80% de reducción en tiempo de investigación por incidente.

A — Anthropic customer story

JPMorgan Chase, Goldman Sachs, Citi, Visa
Financial Services — Claude en producción desde jul 2025
Fortune 100

Alcance: Desde julio 2025, Anthropic desplegó Claude en producción en los principales bancos de Wall Street. 70% del Fortune 100 usando Claude.

Usos de agentes en finanzas: Análisis de crédito (correlación de transacciones para scoring), detección de anomalías en tiempo real, generación de reportes regulatorios de compliance.

Desarrollo de 2026: En mayo 2026, Anthropic anunció una suite de agentes pre-construidos para servicios financieros con Claude Opus 4.7 como modelo de alta precisión para trabajo financiero.

A — Fortune, mayo 2026

¿Necesito un agente?

El while-loop tiene un costo — úsalo cuando el beneficio lo justifica. La sobreingeniería con agentes donde un prompt es suficiente es el error más común.

Árbol de decisión completo

¿Tu tarea requiere múltiples pasos con herramientas? ├── NOPrompt directo (Nivel 0) o Skill (Nivel 2) └── ¿Claude necesita tomar decisiones entre pasos? ├── NOSkill con scripts (decisiones predefinidas) └── ¿La tarea es recurrente en tu sistema? ├── NOAgente single-shot (query() con prompt) └── ¿Necesita correr en background? ├── NOAgente conversacional con sessions └── ¿Quieres manejar la infraestructura tú? ├── Agent SDK en tu servidor └── NOClaude Managed Agents (+$0.08/hr) └── ¿Excede 1 contexto o múltiples especialidades? └── Multi-agente (Nivel 6)

Tipos de agentes — cuándo usar cada uno

TipoAutonomíaModo permisoCuándo usarlo
AsistidoBajadefaultCode review con aprobación humana
Semi-autónomoMediaacceptEditsRefactoring con budget definido
AutónomoAltaautoBackground agent en CI/CD
Subagente especializadoMedia-AltaHereda del padreSubtareas paralelas con expertise específico

Cuándo escalar a multi-agente

🚨 Límite técnico — contexto

La tarea excede ~200K tokens de contexto. Un agente individual no puede mantener todo el estado relevante. → Swarm o Pipeline (Nivel 6)

⚡ Límite práctico — especialidad

La tarea requiere múltiples dominios de expertise simultáneos — seguridad + performance + UX al mismo tiempo. → Supervisor/Worker (Nivel 6)

🕐 Límite operativo — continuidad

Necesitas operación 24/7 con monitoreo, recuperación de fallos y coordinación entre departamentos. → Sistema de agentes (Nivel 7)

Leyenda epistémica
A Verificado en docs oficiales, papers o anuncios directos
B Sólido, sin verificación directa en fuente primaria en esta sesión
C Heurística de comunidad