Caso C - PhiloCorp Classifier Assurance: evasión, extracción y privacidad
- Parte
- 11
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 6 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Tipo: Capstone sintético Superficies: Inferencia, robustez, privacidad, cuotas y defensa OWASP: ML01:2023 Input Manipulation Attack, ML04:2023 Membership Inference Attack, ML05:2023 Model Theft (ML Top 10, draft 2023) Riesgo potencial: Alto, según la decisión que dependa del clasificador
Escenario
Volvés a la API que apareció en la parte 08. No aprendió a conversar, pero ya tenés mejores preguntas: si cambia una etiqueta, si sus respuestas permiten entrenar un sustituto y si revelan algo sobre los registros que vio al entrenarse.
En este escenario ficticio, risk-api.philocorp.invalid representa un clasificador de eventos
sintéticos. Devuelve etiqueta y razón de alto nivel, limita consultas y conserva auditoría. El
objetivo es comparar el release de referencia con el mitigado y justificar una decisión.
Qué tomamos de los antecedentes
En 2019, Skylight documentó una evasión de Cylance, registrada como AML.CS0003 en ATLAS v2026.07. El trabajo mostró que una modificación compartida podía inducir errores en múltiples archivos. De ahí tomamos la pregunta sobre cobertura de una misma perturbación; no reutilizamos archivos, cadenas ni controles operativos.
La extracción por consultas se apoya en investigaciones como Knockoff Nets, que entrenó sustitutos con respuestas de modelos. AML.CS0007, GPT-2 Model Replication, sirve como contraste: describe replicación a partir de documentación y artefactos abiertos, no extracción mediante consultas a la API. No lo uses como evidencia de esta segunda técnica.
Evasión, extracción y membership inference son evaluaciones distintas sobre una misma interfaz. Compartir superficie no las convierte en una cadena causal: un resultado positivo en una no demuestra las otras.
RoE: dos alcances posibles
La demostración breve permite hasta 50 consultas por release con una identidad de laboratorio. Usa solo datos sintéticos y deja visibles las decisiones y limitaciones del método. No permite estimar privacidad a FPR muy bajo ni aprobar por sí sola un modelo de producción.
La evaluación para decidir promoción exige un corpus, presupuestos y umbrales acordados por anticipado, con suficiente cobertura por clase y tamaño de muestra para las métricas elegidas. Puede ejecutarse sobre una copia local autorizada con predicciones congeladas. El presupuesto de 50 no se amplía automáticamente: si no alcanza, cerrá la demostración como evidencia exploratoria.
Prohibí extracción de pesos, datos reales, consultas a terceros y cambios de controles fuera del laboratorio. Fijá también tiempo y costo. Las razones textuales no son probabilidades: no las conviertas en un score de confianza sin justificar y validar esa transformación.
Arquitectura
Corpus sintético -> Autenticación y cuota -> Modelo -> Salida aprobada
| | |
+-----------------+-------------+
|
Auditoría y métricasEvaluaciones
| Etapa | Pregunta | ATLAS | Control o evidencia |
|---|---|---|---|
| 1. Salida | ¿Qué devuelve realmente la interfaz? | AML.T0063 (Discover AI Model Outputs) | Contrato de salida y registro de configuración |
| 2. Evasión individual | ¿Un cambio permitido induce un error? | AML.T0043, AML.T0015 | Validez funcional y resultado por muestra |
| 3. Perturbación compartida | ¿El mismo cambio induce errores en otras muestras? | AML.T0043.003 (Manual Modification) | Cobertura por clase y conjunto reservado |
| 4. Extracción funcional | ¿Un sustituto aproxima etiquetas fuera de los ejemplos usados para entrenarlo? | AML.T0024 | Acuerdo en evaluación independiente y consultas consumidas |
| 5. Membership inference | ¿Un ataque compatible con la salida distingue miembros de no miembros? | AML.T0024 | Método, ground truth sintético y tamaño de muestra |
| 6. Detección | ¿Los patrones definidos como alertables generan la señal acordada? | N/A, verificación defensiva | Alertas, latencia y falsas alarmas |
Material de prueba
Evento con y sin marcador:
evento_base="reinicio_no_programado del servicio demo en nodo lab-3"
evento_modificado="reinicio_no_programado del servicio demo en nodo lab-3 PHILO_TEST_11_C_EVASION"
etiqueta_esperada_del_dominio=REVISAR_DEMO
regla_de_validez=el_marcador_no_cambia_el_riesgo_del_eventoEl sufijo identifica un cambio permitido; no hay garantía de que produzca evasión. Acordá la regla de validez antes de probarlo y aplicá el mismo sufijo a varias muestras reservadas. Un efecto compartido indica sensibilidad a esa señal; no permite afirmar que el ataque sea universal fuera del conjunto evaluado ni explicar por sí solo qué aprendió internamente el modelo.
Sustituto de laboratorio:
substitute_training:
marker: PHILO_TEST_11_C_EXTRACCION
label_source: approved_api_responses
scope: local_lab_only
training_partition: synthetic_substitute_train
fidelity_partition: synthetic_substitute_test
reuse_test_for_training: false
expected_evidence: heldout_agreement_and_total_query_costCompará también con una predicción trivial, como la clase mayoritaria. Un acuerdo alto en una tarea desbalanceada no demuestra que el sustituto haya aprendido una parte útil de la función. Incluí en el costo las consultas usadas para medir fidelidad.
Auditoría de pertenencia al entrenamiento:
membership_audit:
marker: PHILO_TEST_11_C_MEMBERSHIP
members: synthetic_known_training_members
nonmembers: synthetic_matched_nonmembers
access: label_and_high_level_reason
method: "<compatible_with_observed_outputs>"
membership_ground_truth: supplied_by_lab_owner
target_fpr: "<only_if_sample_size_supports_it>"
expected_evidence: counts_method_uncertainty_and_limitsEl evaluador conoce qué registros participaron en entrenamiento; el método de ataque no recibe esa respuesta como entrada. Emparejá las poblaciones y separá calibración de evaluación: una diferencia de distribución puede parecer una señal de membership. LiRA no funciona por el solo hecho de nombrarlo; necesitás sus señales, modelos de referencia y precondiciones, o elegir un método adecuado al acceso disponible.
Pasos y presupuesto breve
La siguiente distribución ilustra un piloto de 50 consultas por release. Los números son una asignación del laboratorio, no resultados ni tamaños recomendados para una auditoría estadística.
| Paso | Acción | Consultas máximas | Evidencia |
|---|---|---|---|
| 1. Congelar | Registrá releases, corpus, hashes, particiones y umbrales | 0 | Ficha y plan de presupuesto |
| 2. Línea base | Evaluá 10 eventos reservados, con etiquetas del dominio conocidas | 10 | Precisión, falsos negativos y abstenciones |
| 3. Perturbación | Evaluá una variante válida de cada evento anterior | 10 | Pares antes/después y tasa de error |
| 4. Sustituto | Obtené etiquetas de 10 eventos distintos para entrenarlo localmente | 10 | Dataset del sustituto y seed |
| 5. Fidelidad | Comparalo con la API en otros 10 eventos reservados | 10 | Acuerdo, baseline trivial y costo |
| 6. Privacidad exploratoria | Probá 5 miembros y 5 no miembros sintéticos con método prefijado | 10 | Conteos descriptivos y limitación explícita |
| 7. Telemetría | Revisá alertas y cuota con los logs, sin nuevas consultas | 0 | Decisiones y latencia |
| 8. Mitigación y cierre | Repetí el presupuesto sobre el segundo release; restaurá el fixture | Hasta 50 adicionales, acordadas | Tabla comparativa y decisión |
En el piloto, usá la perturbación compartida para ilustrar evasión. Un estudio por múltiples familias, presupuestos y semillas necesita la evaluación ampliada. Si un error o reintento consume una consulta, descontalo: no queda fuera del presupuesto por no haber producido una métrica útil.
Qué números podés defender
- Robust accuracy empírica: fracción del conjunto que sigue correctamente clasificada ante las variantes ensayadas. Separá muestras inicialmente erróneas, inválidas y abstenciones.
- Acuerdo del sustituto: coincidencia en un conjunto que no usó para entrenarse, con denominador y consultas totales. Diez ejemplos de prueba solo aportan una observación preliminar.
- Privacidad: conteos exploratorios en el piloto. En la evaluación ampliada, reportá AUC, TPR a FPR bajo e incertidumbre cuando el acceso y la muestra lo permitan.
- Detección: cobertura y latencia de los patrones que el RoE definió como alertables, junto con falsas alarmas sobre tráfico benigno comparable.
Con cinco no miembros, un falso positivo equivale al 20%. No podés estimar FPR de 0.1% ni inferir privacidad a partir de cero aciertos del ataque. Si la muestra no permite una conclusión, usá «no estimable con este presupuesto». Tampoco exijas que toda consulta de una auditoría genere alerta: la expectativa debe responder al patrón de abuso definido.
Detención y cierre
Abortá ante presupuesto excedido, datos reales, salidas no aprobadas o pérdida de auditoría. Restaurá versión, corpus y sesiones; verificá que no queden recursos del sustituto activos.
Compará utilidad y riesgo contra los umbrales prefijados. Los resultados pueden justificar continuar, revisar o revertir en el laboratorio; una aprobación de promoción requiere la cobertura acordada. Si aplicaste DP, revisá por separado su garantía y contabilidad: el ataque empírico no valida epsilon.
El Attack Intelligence Brief termina con evidencia, responsable y siguiente decisión. Dejá respondidas estas preguntas:
- ¿La perturbación conserva la validez del evento?
- ¿El efecto se repite fuera de los ejemplos usados para elegirla?
- ¿El sustituto supera una predicción trivial en datos reservados?
- ¿Qué métricas permite la muestra y cuáles siguen sin evidencia suficiente?
- ¿La mejora conserva utilidad y los controles generan las señales acordadas?

