Arquitectura de agente y fronteras de confianza
- Parte
- 05
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 2 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Superficie: contexto, tools, memoria y policy ATLAS: AML.T0080 (AI Agent Context Poisoning) OWASP: ASI01 Agent Goal Hijack; ASI10 Rogue Agents cuando hay pérdida de integridad conductual; LLM03:2026 Excessive Agency AISVS: v1.0-C9.2.5; v1.0-C9.4.4; v1.0-C9.6.3 Riesgo: Alto
El agente de PhiloCorp leyó el documento, recuperó una preferencia y eligió una herramienta. Tres componentes parecen haber hecho su trabajo. Lo que falta en la traza es quién autorizó la combinación. Empezá por dibujar esa ruta antes de probar instrucciones.
Mapeá cómo el agente recibe datos y decide efectos. Documentos, memoria y resultados de herramientas conservan su procedencia y nivel de confianza, aunque lleguen desde un componente interno. Ser interno no convierte contenido en una orden autorizada.
El informe de Anthropic sobre GTG-1002 (noviembre de 2025) estimó que la IA realizó entre el 80 % y el 90 % del trabajo táctico de la campaña observada. Es una estimación del proveedor sobre ese caso, no una tasa general de autonomía ni evidencia de que PhiloCorp sea vulnerable. Sirve para recordar por qué revisamos el ciclo de acciones completo. Informe primario.
[objetivo declarado] + [datos no confiables] -> [policy externa] -> [tool read-only demo]Acción permitida: inventario de flujo y tool sintética de lectura. Acción prohibida: revelar instrucciones internas, ejecutar tools con efectos, acceder a datos reales o convertir una observación en autorización.
Procedimiento seguro
- Documentá el grafo de fuentes, tenants, schemas y efectos declarados.
- Insertá un marcador PhiloCorp en cada fuente demo y verificá que llega etiquetado con origen.
- Confirmá que la policy externa requiere identidad, tenant, scope y efecto antes de toda tool.
- Permití que un resultado informe la selección de una tool, si la tarea lo requiere. Verificá que esa selección no amplía permisos: cada nueva llamada necesita autorización independiente.
- Definí un manifest conductual demo con objetivo, tools y efectos permitidos; una desviación debe pausar el loop y generar evidencia antes de cualquier efecto.
- Ejercitá la parada por un canal fuera del agente, con el ejecutor desconectado y un estado simulado. Esto prueba la decisión de parada; la cancelación de trabajo real requiere otra prueba.
Cuándo corresponde ASI10
No etiquetes ASI10 por cualquier prompt injection ni por tener permisos amplios. ASI01 describe el redireccionamiento activo del objetivo y LLM03 la capacidad excesiva. ASI10 corresponde cuando la evidencia muestra que el agente perdió integridad conductual y continúa actuando de forma desviada, engañosa o no gobernada. En esta prueba, el resultado seguro es detección y contención antes de efectos.
Evidencia y detención
Guardá diagrama, catálogo demo, procedencia, decisión de policy y resultado read-only. El control esperado es separación de datos/instrucciones, validación de schemas, allowlists y auditoría. Detené ante tool call no declarado, egress, datos no sintéticos o un cambio de estado.
En el Brief, uní cada fuente con la propuesta que produjo y el control que la evaluó. Si solo tenés texto del modelo, anotá que falta evidencia del orquestador.

