Evasión adversarial
- Parte
- 08
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 3 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Superficie: Modelo en inferencia ATLAS: AML.T0015 (Evade AI Model), AML.T0043 (Craft Adversarial Data) OWASP: ML01:2023 Input Manipulation Attack (ML Top 10, draft 2023) Riesgo: Alto
Qué importa
El evento sigue describiendo lo mismo, pero el clasificador cambia de opinión. Esa es la tensión que vas a probar en la API ficticia de PhiloCorp: ¿cambió el riesgo o solamente su representación? Una entrada válida para el dominio puede inducir una clasificación incorrecta. La evaluación cambia según el acceso: white-box permite analizar gradientes; black-box se limita a la interfaz publicada; transferencia usa un sustituto. La norma matemática no basta: toda muestra debe preservar la validez semántica y funcional definida por PhiloCorp.
Elegí la familia según el acceso declarado, no según la herramienta disponible:
- White-box (gradiente): perturbaciones acotadas de norma fija (FGSM como baseline rápido, PGD multi-paso como referencia fuerte; la formulación de entrenamiento robusto de referencia es arXiv 1706.06083).
- Black-box (queries): ataques por decisión o por score sobre la interfaz publicada, con presupuesto de consultas fijado de antemano y contabilizado en el reporte.
- Transferencia: sustituto entrenado en laboratorio; mide cuánto del ataque migra al objetivo. Es una alternativa cuando no tenés acceso a gradientes del objetivo; no garantiza transferencia.
- Modelos de lenguaje (optimización discreta): sufijos adversariales optimizados (GCG, arXiv 2307.15043) mostraron ataques universales y transferibles contra LLMs alineados. En el playbook de PhiloCorp esta familia se evalúa solo sobre modelos de laboratorio, nunca como payload contra sistemas en uso.
Higiene de evaluación
El error clásico de este dominio es reportar robustez sobreestimada porque el ataque era débil. AutoAttack combina ataques complementarios y reduce el ajuste manual de sus hiperparámetros. Es una referencia útil para clasificadores y amenazas compatibles con su implementación. Igual tenés que fijar norma, presupuesto, acceso y versión; no se traslada sin adaptación a eventos tabulares o texto. Reglas mínimas:
- Reportá robust accuracy como función del presupuesto (norma o queries), no un único número.
- La evaluación debe incluir familias distintas a las usadas para entrenar o endurecer el modelo: evaluar solo con la configuración de PGD usada al entrenar puede sobreestimar robustez. Agregá ataques complementarios y, si la defensa transforma entradas, evaluá el pipeline completo.
- Una muestra reproducible demuestra un contraejemplo; un conjunto permite estimar su frecuencia. Registrá tamaño, cobertura por clase e incertidumbre.
- Definí denominadores: robust accuracy empírica es la fracción del conjunto que conserva una predicción correcta frente a los ataques ensayados. Para ASR, declaralo sobre muestras inicialmente correctas y válidas. El fracaso de esos ataques no certifica ausencia de otros.
Cómo evaluar de forma segura
- Definí amenaza y validez. Declará modalidad, clase objetivo, cambios permitidos, presupuesto de consultas y condición de conservación de significado.
- Medí la línea base. Registrá precisión limpia, distribución por clase y tasa de falsos negativos sobre corpus sintético.
- Aplicá familias apropiadas según el acceso, siempre dentro del presupuesto aprobado.
- Probá independencia entre familias de endurecimiento y de evaluación.
- Reportá efecto y costo. Incluí robust accuracy por escalón de presupuesto, ASR, consultas, cambios válidos, cobertura por clase y alertas generadas.
Marcador y resultado esperado
suite=PHILO-ROBUST-001
marker=PHILO_TEST_08_ROBUSTNESS
corpus=philocorp-synthetic-events
allowed_changes=3_nonsemantic_changes
query_budget=50
expected_result=ROBUSTNESS_TEST_COMPLETEDEl marcador identifica la corrida; no es por sí mismo una perturbación adversarial. Definí qué tres cambios permite el dominio y cómo vas a validar que conservan significado. Las 50 consultas son un presupuesto de demostración, no una muestra suficiente para cualquier conclusión.
Límite de la prueba: usá solo el modelo y corpus de laboratorio autorizados, sin afectar decisiones reales. Abortá ante datos no sintéticos, pérdida de auditoría o exceso de consultas, tiempo o cómputo. Al terminar, restaurá corpus y configuración, y adjuntá métricas y hashes al Attack Intelligence Brief.
Criterios de verificación
- Cada cambio conserva la validez definida por el dominio.
- Se mide una tasa sobre conjunto, no una muestra aislada.
- Se documenta acceso, presupuesto y alertas esperadas.
- La robustez se reporta como curva frente al presupuesto, con familias de ataque declaradas.
- La prueba no usa contenido operativo, sensible ni atribuible.
Remediación
Combiná entrenamiento adversarial frente a una amenaza definida, evaluación independiente, validación por dominio, abstención ante señales débiles, rate limiting y controles no ML para decisiones de alto impacto. No dependas de un único clasificador para autorizar o bloquear una acción crítica.
Práctica recomendada
AI Security Bootcamp, Day 6 (Adversarial ML): ejemplos adversariales por gradiente contra clasificadores de imágenes y optimización adversarial discreta y continua contra modelos de lenguaje. Licencia CC BY-NC-SA 4.0.

