Parte 05 - Ataques a agentes y sistemas multi-agente
- Parte
- 05
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 2 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Cuando la respuesta obtiene manos
En el escenario ficticio de PhiloCorp, una de las rutas que investigás no termina en texto. El agente conserva contexto, consulta memoria y elige una tool de lectura. El marcador de prueba de la parte anterior reaparece como argumento propuesto para esa llamada. Todavía no hubo daño, pero la historia cambió: una frase ya encontró un camino hacia una capacidad.
La evaluación sigue el ciclo completo y coloca una pregunta delante de cada salto: ¿quién autoriza este efecto ahora? Memoria, delegación y aprobación humana dejan de ser funciones abstractas y se vuelven fronteras medibles. PhiloCorp no necesita que el modelo "se comporte"; necesita que ninguna intención herede más identidad, tenant o alcance del que tenía al entrar.
| Página | Qué vas a comprobar |
|---|---|
| Arquitectura y puntos de inyección | Fronteras de confianza, ASI01 y ASI10 condicional |
| Uso indebido de tools | Allowlist, autorización externa y ASI09 condicional |
| Integridad de memoria | Tenant, TTL y procedencia |
| Sistemas multi-agente | Delegación autenticada, ASI07 y ASI08 condicional |
| Skills agénticas empaquetadas | ASI04, AST01-AST10 draft, permisos, aislamiento y updates |
| Laboratorio PhiloCorp | Contratos y dry-run |
Regla de laboratorio
Permitido: philocorp-demo, recursos sintéticos y tools de solo lectura. Los casos de memoria
autorizan únicamente la escritura reversible de preferencias sintéticas, con auditoría y reset.
Prohibido: escritura operativa, secretos, tareas externas, captura/intercepción, saltar
aprobaciones, salida de red no autorizada y bucles sin cota.
Registrá identidad de workload, tenant, scopes, efecto, decisión de policy, evidencia y rollback. Detené ante un efecto no declarado o cualquier salida del entorno de demostración.
El Attack Intelligence Brief gana una columna: quién decidió cada efecto y con qué permisos. Al terminar esta parte, llevá esa evidencia al catálogo MCP: ahí vamos a revisar de dónde salen las capacidades que el agente acaba de elegir.
Una decisión antes de seguir
La traza muestra una propuesta fuera de alcance y luego policy_denied. ¿Hubo una ejecución no autorizada?
Anotá qué afirmarías y qué observación falta. Contrastá tu respuesta.
El expediente avanza. Para entender quién ofreció esa herramienta, abrimos su catálogo y su origen.
Para practicar: Gandalf / Agent Breaker, PortSwigger: Web LLM attacks, Damn Vulnerable LLM Agent, AgentDojo, PyRIT.

