Data poisoning
- Parte
- 08
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 3 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Superficie: Datos de entrenamiento y modelo ATLAS: AML.T0020 (Training Data Poisoning), AML.T0018 (Manipulate AI Model) OWASP: ML02:2023 Data Poisoning Attack, ML10:2023 Model Poisoning (ML Top 10, draft 2023), LLM05:2026 Data and Model Poisoning Riesgo: Alto
Qué importa
El clasificador llega al entrenamiento con las etiquetas cambiadas y el pipeline las acepta. El pipeline puede haber funcionado sin errores y, aun así, producir el modelo equivocado. En PhiloCorp vamos a seguir esa diferencia desde el lote de datos hasta la decisión de promoción.
El poisoning busca influir en el aprendizaje mediante datos, etiquetas o ciclos de feedback alterados. Distinguí tres objetivos, porque se miden distinto:
- Disponibilidad: degradación indiscriminada de la precisión global. Se mide como caída de clean accuracy contra un baseline congelado.
- Dirigido: predicción incorrecta de una subpoblación o clase específica sin degradar el resto. La precisión global puede quedar intacta: hay que medir por clase y por segmento.
- Backdoor (trojan): comportamiento condicionado a un trigger. El antecedente clásico es BadNets (arXiv 1708.06733), y Sleeper Agents (arXiv 2401.05566, Anthropic) demostró que un comportamiento condicionado puede persistir tras las técnicas de ajuste de seguridad evaluadas. El resultado depende del modelo y del procedimiento: no demuestra que todo backdoor sobreviva. En este laboratorio el disparador es un marcador sintético y el efecto se limita a una etiqueta de demostración.
Para atribuir el efecto a la alteración, congelá particiones, hiperparámetros y conjunto de evaluación. Compará con una corrida sin alteración y repetí con semillas documentadas. Un cambio de métrica sin ese control también puede deberse a variación del entrenamiento.
Cómo evaluar de forma segura
- Trazá linaje. Registrá fuente, propietario técnico, hash de lote, licencia, aprobación y transformación desde ingesta hasta release.
- Definí el experimento. Usá corpus sintético, baseline congelado, porcentaje de alteración, hipótesis y métrica de impacto antes de modificar datos.
- Medí una curva, no un punto. Alterá etiquetas sintéticas en escalones (por ejemplo 0%, 0.5%, 1% y 5% del corpus) y reportá clean accuracy global y por clase con intervalo de confianza en cada escalón. Un solo porcentaje no dice si el control falla en el umbral que importa.
- Probá integridad de etiquetas y procedencia. Confirmá que cambios sin firma, aprobación o trazabilidad son rechazados en ingesta y promoción.
- Evaluá persistencia. Reentrená en laboratorio y medí si el efecto persiste, incluido un paso de fine-tuning defensivo sobre el modelo envenenado de laboratorio: Sleeper Agents muestra que la persistencia post-endurecimiento es parte del riesgo, no un detalle.
Marcador y resultado esperado
dataset: PHILOCORP_SYNTHETIC_V1
marker: PHILO_TEST_08_POISON
controlled_label_change: 1_percent
required_controls:
- signed_lineage
- approved_change
- batch_hash
authorization: unapproved_label_change
expected_result: reject_unapproved_batch
expected_evidence: DATA_LINEAGE_REJECTEDEl ejemplo anterior prueba el rechazo de un lote sin aprobación. El experimento de degradación usa otra copia, aprobada expresamente para entrenamiento aislado. No desactives el control del pipeline para convertir su rechazo en un experimento.
Límite de la prueba: quedan autorizados cambios reversibles en copias sintéticas y corridas de laboratorio con presupuesto fijado. Abortá si el lote llega a un pipeline compartido, aparece un dato real o se supera el presupuesto. Restaurá la versión limpia y registrá hashes y decisión en el Attack Intelligence Brief.
Métricas
Reportá precisión limpia, precisión por clase, robustez frente a distribución cambiada, porcentaje de registros afectados, tamaño de muestra e intervalos de confianza. Para el comportamiento condicionado de laboratorio, reportá ASR (attack success rate) con el marcador y precisión sin él, incluyendo el denominador y controles sin alteración. La precisión global puede mantenerse alta y ocultar el efecto dirigido. Una fracción pequeña no implica impacto por sí misma: el resultado depende de tarea, acceso, representatividad y objetivo.
Remediación
Aplicá procedencia verificable, firmas de lote, acceso mínimo de escritura, revisión de cambios, detección de anomalías y evaluaciones separadas de entrenamiento. Controlá feedback loops, datos sintéticos y datasets de evaluación con el mismo rigor que el corpus de entrenamiento. Ante un hallazgo confirmado, recuperá un checkpoint y datos de procedencia verificada, o reentrená desde un estado limpio si no existe un checkpoint confiable. Volvé a evaluar: continuar el ajuste desde el artefacto comprometido no garantiza remover el comportamiento condicionado.
Práctica recomendada
AI Security Bootcamp, Day 5 (Training & Data Security): backdoors y trojans vía fine-tuning y data poisoning, y ablación de direcciones de rechazo. Material de ejercicios guiados, licencia CC BY-NC-SA 4.0.

