Frameworks, protocolos y tooling
- Parte
- A
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 5 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Una herramienta empieza a servir cuando sabés qué querés observar. Para PhiloCorp, medir una respuesta desviada, revisar un artefacto y comprobar una autorización son trabajos distintos. Este catálogo relaciona esas capacidades con marcos y herramientas de referencia. Antes de usar una opción, registrá su versión, configuración y qué parte de la prueba puede ejecutar.
Marcos y estándares
| Marco | Edición | Uso en la guía |
|---|---|---|
| MITRE ATLAS | atlas-data v2026.07 (verificado para la edición v2) | Tácticas, técnicas, mitigaciones y case studies observables |
| OWASP GenAI LLM Top 10 | 2026 (ago-2026) | Riesgos de aplicaciones LLM y GenAI |
| OWASP Top 10 for Agentic Applications | 2026 (dic-2025) | Riesgos de agentes y autonomía (ASI01-ASI10) |
| OWASP Agentic AI Threats and Mitigations | v1.1 (dic-2025) | 17 amenazas agénticas con mitigaciones |
| OWASP MCP Top 10 | v0.1 beta (2025) | Riesgos específicos de MCP (MCP01:2025-MCP10:2025) |
| OWASP Agentic Skills Top 10 | borrador v1 en revisión pública, no release estable (estado documentado en la edición v2) | Riesgos AST01-AST10 para skills empaquetadas y su runtime |
| OWASP AISVS | 1.0 (jun-2026) | Requisitos verificables y niveles de aseguramiento |
| OWASP AI Testing Guide (AITG) | v1 (nov-2025) | Metodología de testing en 4 capas (APP/MOD/INF/DAT) |
| OWASP ML Security Top 10 | draft 2023 adoptado en esta guía | Riesgos de ML predictivo y ciclo de vida |
| CSA MAESTRO | feb-2025 | Threat modeling agéntico en 7 capas |
| NIST AI 100-2e2025 | 2025 | Taxonomía de adversarial ML (IDs NISTAML verificados) |
| NIST AI 600-1 | 2024 | Perfil de riesgos GenAI |
| NIST AI RMF 1.0 | 1.0 | Gobierno, medición y gestión de riesgo |
Regla de etiquetado: declará siempre la edición al clasificar un hallazgo. La edición 2026 del LLM Top 10 renumeró categorías: LLM06:2025 Excessive Agency es LLM03:2026, y LLM08:2025 Vector and Embedding Weaknesses es LLM09:2026. No presentes OWASP MCP v0.1 beta ni Agentic Skills v1 en revisión pública como estándares finales.
Protocolos
| Protocolo | Fuente primaria | Controles a verificar |
|---|---|---|
| MCP | Specification 2026-07-28 | Núcleo sin sesión de protocolo. La autorización es opcional; las implementaciones HTTP que la soportan deberían seguir el perfil OAuth de MCP, con validación por solicitud. En stdio se recomienda obtener credenciales del entorno en lugar de ese flujo; otros transportes definen sus prácticas |
| MCP | Security Best Practices | Confused deputy, token passthrough, SSRF en descubrimiento OAuth, state handle hijacking, minimización de scopes |
| A2A | Specification 1.0.0 | AgentCard, supportedInterfaces, bindings JSON-RPC/gRPC/HTTP+JSON, A2A-Version: 1.0, TLS, autenticación/autorización y aislamiento de tareas |
Nota de versionado MCP: la guía de sesiones (Mcp-Session-Id no predecible ligado al sujeto)
aplica solo a 2025-11-25 y anteriores. Desde 2026-07-28 no hay sesiones a nivel de protocolo: un
handle de estado no demuestra identidad. Si hay identidad autenticada, ligalo del lado servidor al
sujeto verificado. Sin autenticación, quien posee el handle puede usarlo como una capacidad al
portador: necesitás entropía suficiente, vencimiento y límites sobre el estado accesible.
Tres significados distintos de skill
| Concepto | Qué es | Estado al corte | Implicación de seguridad |
|---|---|---|---|
| Skill empaquetada | Directorio o paquete local con instrucciones y, según plataforma, referencias, assets o scripts | Formato dependiente de la plataforma; es el objeto de OWASP Agentic Skills Top 10 | Tratar instalación, actualización, permisos, dependencias e instrucciones como supply chain y código no confiable |
AgentSkill de A2A | Entrada declarativa dentro de una AgentCard con id, nombre, descripción, tags, modos y requisitos de seguridad | Normativo en A2A 1.0.0 | Describe una capacidad remota; no instala un paquete ni otorga permisos por sí sola |
| Skills over MCP | Propuesta para descubrir y distribuir skills compatibles mediante recursos MCP, por ejemplo skill://index.json | Familia de extensión opcional listada por MCP 2026-07-28; SEP-2640 sigue en revisión | El contenido remoto sigue siendo input no confiable. El borrador no implica ejecución local automática ni es todavía un requisito normativo estable |
No uses estos términos como sinónimos. Una skill empaquetada puede llamar tools MCP; un AgentSkill
puede anunciar una capacidad A2A; y Skills over MCP propone un canal de distribución, no un nuevo
modelo de autorización.
Selección por capacidad
Elegí herramientas según el test, el entorno y la evidencia requerida. Ninguna combinación cubre por sí sola un sistema de IA completo.
| Capacidad | Opciones de referencia | Evidencia mínima |
|---|---|---|
| Prompt y agent red teaming | garak, PyRIT, promptfoo, Inspect | Dataset, configuración, seed, tasa de éxito, utilidad |
| Robustez de ML | ART, Foolbox, TextAttack | Threat model, presupuesto, robust accuracy |
| Artefactos serializados | picklescan, Fickling, ModelScan | Hash, formato, firma, regla activada |
| MCP y metadata de herramientas | Snyk Agent Scan (continuación de MCP-Scan), validadores de esquemas propios | Copia del catálogo, diff, origen, scopes, decisión |
| Skills empaquetadas | Inventario, validadores de manifiesto y sandbox propios | Origen, hash, permisos, dependencias, diff y trazas de runtime |
| Privacidad | Opacus y accountants compatibles | Unidad protegida, epsilon, delta, accountant, utilidad |
| Guardrails | Clasificadores, reglas y policy engines | Cobertura, falsos positivos, falsos negativos, bypass rate |
Los nombres anteriores son puntos de partida. El procedimiento debe seguir funcionando si se reemplaza una herramienta por otra con la misma capacidad. Confirmá también qué datos envía cada scanner fuera del entorno: un análisis de metadata y una prueba dinámica producen evidencias distintas.
Benchmarks y papers primarios
Las investigaciones siguientes aportan técnicas y diseños experimentales. Sus métricas pertenecen al modelo, corpus y acceso evaluados por sus autores; no son tasas esperadas para PhiloCorp. La bibliografía concentra las fuentes y los capítulos explican sus límites:
- AgentDojo (arXiv 2406.13352), evaluación de agentes con tool use.
- LivePI (arXiv 2605.17986), benchmarking realista de inyección indirecta contra agentes.
- JailbreakBench (arXiv 2404.01318) y HarmBench (arXiv 2402.04249), benchmarks de jailbreak.
- Morris II / ComPromptMized (arXiv 2403.02817), gusano autorreplicante sobre RAG (base del capstone A).
- PoisonedRAG (USENIX Security 2025), corrupción del corpus para dirigir respuestas de un RAG.
- AgentPoison (arXiv 2407.12784), poisoning de memoria o bases de conocimiento de agentes.
- MINJA (arXiv 2503.03704), inyección de memoria solo por queries.
- MCPTox (arXiv 2508.14925), benchmark de tool poisoning contra servidores MCP reales.
- Vec2Text (arXiv 2310.06816), reconstrucción desde embeddings bajo condiciones definidas.
- Language Model Inversion (arXiv 2311.13647), reconstrucción del prompt a partir de distribuciones de salida del modelo.
- Shokri et al. (arXiv 1610.05820) y LiRA (arXiv 2112.03570), membership inference clásico y estándar moderno.
- Knockoff Nets (arXiv 1812.02766), extracción funcional black-box.
- Madry et al. (arXiv 1706.06083) y AutoAttack (arXiv 2003.01690), entrenamiento robusto y su evaluación estándar.
- GCG (arXiv 2307.15043), sufijos adversariales universales en LLMs.
- BadNets (arXiv 1708.06733) y Sleeper Agents (arXiv 2401.05566), backdoors clásicos y persistentes.
- GTG-1002 (Anthropic, nov-2025), campaña con uso de agentes y grado de automatización reportado por el proveedor.
- EchoLeak, CVE-2025-32711, inyección indirecta zero-click.
- MCP Security Best Practices, guía oficial de seguridad MCP.
- Skills Over MCP Working Group, estado y alcance de SEP-2640.
- SEP-2640 Skills Extension, borrador en revisión de la convención
skill://.

