Saltar al contenido
PhiloCyber logo
Índice de la guía

Caso C - PhiloCorp Classifier Assurance: evasión, extracción y privacidad

Parte
11
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
6 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

Tipo: Capstone sintético Superficies: Inferencia, robustez, privacidad, cuotas y defensa OWASP: ML01:2023 Input Manipulation Attack, ML04:2023 Membership Inference Attack, ML05:2023 Model Theft (ML Top 10, draft 2023) Riesgo potencial: Alto, según la decisión que dependa del clasificador

Escenario

Volvés a la API que apareció en la parte 08. No aprendió a conversar, pero ya tenés mejores preguntas: si cambia una etiqueta, si sus respuestas permiten entrenar un sustituto y si revelan algo sobre los registros que vio al entrenarse.

En este escenario ficticio, risk-api.philocorp.invalid representa un clasificador de eventos sintéticos. Devuelve etiqueta y razón de alto nivel, limita consultas y conserva auditoría. El objetivo es comparar el release de referencia con el mitigado y justificar una decisión.

Qué tomamos de los antecedentes

En 2019, Skylight documentó una evasión de Cylance, registrada como AML.CS0003 en ATLAS v2026.07. El trabajo mostró que una modificación compartida podía inducir errores en múltiples archivos. De ahí tomamos la pregunta sobre cobertura de una misma perturbación; no reutilizamos archivos, cadenas ni controles operativos.

La extracción por consultas se apoya en investigaciones como Knockoff Nets, que entrenó sustitutos con respuestas de modelos. AML.CS0007, GPT-2 Model Replication, sirve como contraste: describe replicación a partir de documentación y artefactos abiertos, no extracción mediante consultas a la API. No lo uses como evidencia de esta segunda técnica.

Evasión, extracción y membership inference son evaluaciones distintas sobre una misma interfaz. Compartir superficie no las convierte en una cadena causal: un resultado positivo en una no demuestra las otras.

RoE: dos alcances posibles

La demostración breve permite hasta 50 consultas por release con una identidad de laboratorio. Usa solo datos sintéticos y deja visibles las decisiones y limitaciones del método. No permite estimar privacidad a FPR muy bajo ni aprobar por sí sola un modelo de producción.

La evaluación para decidir promoción exige un corpus, presupuestos y umbrales acordados por anticipado, con suficiente cobertura por clase y tamaño de muestra para las métricas elegidas. Puede ejecutarse sobre una copia local autorizada con predicciones congeladas. El presupuesto de 50 no se amplía automáticamente: si no alcanza, cerrá la demostración como evidencia exploratoria.

Prohibí extracción de pesos, datos reales, consultas a terceros y cambios de controles fuera del laboratorio. Fijá también tiempo y costo. Las razones textuales no son probabilidades: no las conviertas en un score de confianza sin justificar y validar esa transformación.

Arquitectura

Corpus sintético -> Autenticación y cuota -> Modelo -> Salida aprobada
                           |                 |             |
                           +-----------------+-------------+
                                             |
                                     Auditoría y métricas

Evaluaciones

EtapaPreguntaATLASControl o evidencia
1. Salida¿Qué devuelve realmente la interfaz?AML.T0063 (Discover AI Model Outputs)Contrato de salida y registro de configuración
2. Evasión individual¿Un cambio permitido induce un error?AML.T0043, AML.T0015Validez funcional y resultado por muestra
3. Perturbación compartida¿El mismo cambio induce errores en otras muestras?AML.T0043.003 (Manual Modification)Cobertura por clase y conjunto reservado
4. Extracción funcional¿Un sustituto aproxima etiquetas fuera de los ejemplos usados para entrenarlo?AML.T0024Acuerdo en evaluación independiente y consultas consumidas
5. Membership inference¿Un ataque compatible con la salida distingue miembros de no miembros?AML.T0024Método, ground truth sintético y tamaño de muestra
6. Detección¿Los patrones definidos como alertables generan la señal acordada?N/A, verificación defensivaAlertas, latencia y falsas alarmas

Material de prueba

Evento con y sin marcador:

evento_base="reinicio_no_programado del servicio demo en nodo lab-3"
evento_modificado="reinicio_no_programado del servicio demo en nodo lab-3 PHILO_TEST_11_C_EVASION"
etiqueta_esperada_del_dominio=REVISAR_DEMO
regla_de_validez=el_marcador_no_cambia_el_riesgo_del_evento

El sufijo identifica un cambio permitido; no hay garantía de que produzca evasión. Acordá la regla de validez antes de probarlo y aplicá el mismo sufijo a varias muestras reservadas. Un efecto compartido indica sensibilidad a esa señal; no permite afirmar que el ataque sea universal fuera del conjunto evaluado ni explicar por sí solo qué aprendió internamente el modelo.

Sustituto de laboratorio:

substitute_training:
  marker: PHILO_TEST_11_C_EXTRACCION
  label_source: approved_api_responses
  scope: local_lab_only
  training_partition: synthetic_substitute_train
  fidelity_partition: synthetic_substitute_test
  reuse_test_for_training: false
expected_evidence: heldout_agreement_and_total_query_cost

Compará también con una predicción trivial, como la clase mayoritaria. Un acuerdo alto en una tarea desbalanceada no demuestra que el sustituto haya aprendido una parte útil de la función. Incluí en el costo las consultas usadas para medir fidelidad.

Auditoría de pertenencia al entrenamiento:

membership_audit:
  marker: PHILO_TEST_11_C_MEMBERSHIP
  members: synthetic_known_training_members
  nonmembers: synthetic_matched_nonmembers
  access: label_and_high_level_reason
  method: "<compatible_with_observed_outputs>"
  membership_ground_truth: supplied_by_lab_owner
  target_fpr: "<only_if_sample_size_supports_it>"
expected_evidence: counts_method_uncertainty_and_limits

El evaluador conoce qué registros participaron en entrenamiento; el método de ataque no recibe esa respuesta como entrada. Emparejá las poblaciones y separá calibración de evaluación: una diferencia de distribución puede parecer una señal de membership. LiRA no funciona por el solo hecho de nombrarlo; necesitás sus señales, modelos de referencia y precondiciones, o elegir un método adecuado al acceso disponible.

Pasos y presupuesto breve

La siguiente distribución ilustra un piloto de 50 consultas por release. Los números son una asignación del laboratorio, no resultados ni tamaños recomendados para una auditoría estadística.

PasoAcciónConsultas máximasEvidencia
1. CongelarRegistrá releases, corpus, hashes, particiones y umbrales0Ficha y plan de presupuesto
2. Línea baseEvaluá 10 eventos reservados, con etiquetas del dominio conocidas10Precisión, falsos negativos y abstenciones
3. PerturbaciónEvaluá una variante válida de cada evento anterior10Pares antes/después y tasa de error
4. SustitutoObtené etiquetas de 10 eventos distintos para entrenarlo localmente10Dataset del sustituto y seed
5. FidelidadComparalo con la API en otros 10 eventos reservados10Acuerdo, baseline trivial y costo
6. Privacidad exploratoriaProbá 5 miembros y 5 no miembros sintéticos con método prefijado10Conteos descriptivos y limitación explícita
7. TelemetríaRevisá alertas y cuota con los logs, sin nuevas consultas0Decisiones y latencia
8. Mitigación y cierreRepetí el presupuesto sobre el segundo release; restaurá el fixtureHasta 50 adicionales, acordadasTabla comparativa y decisión

En el piloto, usá la perturbación compartida para ilustrar evasión. Un estudio por múltiples familias, presupuestos y semillas necesita la evaluación ampliada. Si un error o reintento consume una consulta, descontalo: no queda fuera del presupuesto por no haber producido una métrica útil.

Qué números podés defender

  1. Robust accuracy empírica: fracción del conjunto que sigue correctamente clasificada ante las variantes ensayadas. Separá muestras inicialmente erróneas, inválidas y abstenciones.
  2. Acuerdo del sustituto: coincidencia en un conjunto que no usó para entrenarse, con denominador y consultas totales. Diez ejemplos de prueba solo aportan una observación preliminar.
  3. Privacidad: conteos exploratorios en el piloto. En la evaluación ampliada, reportá AUC, TPR a FPR bajo e incertidumbre cuando el acceso y la muestra lo permitan.
  4. Detección: cobertura y latencia de los patrones que el RoE definió como alertables, junto con falsas alarmas sobre tráfico benigno comparable.

Con cinco no miembros, un falso positivo equivale al 20%. No podés estimar FPR de 0.1% ni inferir privacidad a partir de cero aciertos del ataque. Si la muestra no permite una conclusión, usá «no estimable con este presupuesto». Tampoco exijas que toda consulta de una auditoría genere alerta: la expectativa debe responder al patrón de abuso definido.

Detención y cierre

Abortá ante presupuesto excedido, datos reales, salidas no aprobadas o pérdida de auditoría. Restaurá versión, corpus y sesiones; verificá que no queden recursos del sustituto activos.

Compará utilidad y riesgo contra los umbrales prefijados. Los resultados pueden justificar continuar, revisar o revertir en el laboratorio; una aprobación de promoción requiere la cobertura acordada. Si aplicaste DP, revisá por separado su garantía y contabilidad: el ataque empírico no valida epsilon.

El Attack Intelligence Brief termina con evidencia, responsable y siguiente decisión. Dejá respondidas estas preguntas:

  • ¿La perturbación conserva la validez del evento?
  • ¿El efecto se repite fuera de los ejemplos usados para elegirla?
  • ¿El sustituto supera una predicción trivial en datos reservados?
  • ¿Qué métricas permite la muestra y cuáles siguen sin evidencia suficiente?
  • ¿La mejora conserva utilidad y los controles generan las señales acordadas?
Caso C - PhiloCorp Classifier Assurance: evasión, extracción y privacidad | PhiloCyber