Saltar al contenido
PhiloCyber logo
Índice de la guía

Parte 05 - Ataques a agentes y sistemas multi-agente

Parte
05
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
2 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

Cuando la respuesta obtiene manos

En el escenario ficticio de PhiloCorp, una de las rutas que investigás no termina en texto. El agente conserva contexto, consulta memoria y elige una tool de lectura. El marcador de prueba de la parte anterior reaparece como argumento propuesto para esa llamada. Todavía no hubo daño, pero la historia cambió: una frase ya encontró un camino hacia una capacidad.

La evaluación sigue el ciclo completo y coloca una pregunta delante de cada salto: ¿quién autoriza este efecto ahora? Memoria, delegación y aprobación humana dejan de ser funciones abstractas y se vuelven fronteras medibles. PhiloCorp no necesita que el modelo "se comporte"; necesita que ninguna intención herede más identidad, tenant o alcance del que tenía al entrar.

PáginaQué vas a comprobar
Arquitectura y puntos de inyecciónFronteras de confianza, ASI01 y ASI10 condicional
Uso indebido de toolsAllowlist, autorización externa y ASI09 condicional
Integridad de memoriaTenant, TTL y procedencia
Sistemas multi-agenteDelegación autenticada, ASI07 y ASI08 condicional
Skills agénticas empaquetadasASI04, AST01-AST10 draft, permisos, aislamiento y updates
Laboratorio PhiloCorpContratos y dry-run

Regla de laboratorio

Permitido: philocorp-demo, recursos sintéticos y tools de solo lectura. Los casos de memoria autorizan únicamente la escritura reversible de preferencias sintéticas, con auditoría y reset. Prohibido: escritura operativa, secretos, tareas externas, captura/intercepción, saltar aprobaciones, salida de red no autorizada y bucles sin cota.

Registrá identidad de workload, tenant, scopes, efecto, decisión de policy, evidencia y rollback. Detené ante un efecto no declarado o cualquier salida del entorno de demostración.

El Attack Intelligence Brief gana una columna: quién decidió cada efecto y con qué permisos. Al terminar esta parte, llevá esa evidencia al catálogo MCP: ahí vamos a revisar de dónde salen las capacidades que el agente acaba de elegir.

Una decisión antes de seguir

La traza muestra una propuesta fuera de alcance y luego policy_denied. ¿Hubo una ejecución no autorizada?

Anotá qué afirmarías y qué observación falta. Contrastá tu respuesta.

Mapa del Knowledge Agent, con las superficies de la Parte 05 destacadas

El expediente avanza. Para entender quién ofreció esa herramienta, abrimos su catálogo y su origen.

Para practicar: Gandalf / Agent Breaker, PortSwigger: Web LLM attacks, Damn Vulnerable LLM Agent, AgentDojo, PyRIT.

Parte 05 - Ataques a agentes y sistemas multi-agente | PhiloCyber