Saltar al contenido
PhiloCyber logo
Índice de la guía

Evasión adversarial

Parte
08
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
3 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

Superficie: Modelo en inferencia ATLAS: AML.T0015 (Evade AI Model), AML.T0043 (Craft Adversarial Data) OWASP: ML01:2023 Input Manipulation Attack (ML Top 10, draft 2023) Riesgo: Alto

Qué importa

El evento sigue describiendo lo mismo, pero el clasificador cambia de opinión. Esa es la tensión que vas a probar en la API ficticia de PhiloCorp: ¿cambió el riesgo o solamente su representación? Una entrada válida para el dominio puede inducir una clasificación incorrecta. La evaluación cambia según el acceso: white-box permite analizar gradientes; black-box se limita a la interfaz publicada; transferencia usa un sustituto. La norma matemática no basta: toda muestra debe preservar la validez semántica y funcional definida por PhiloCorp.

Elegí la familia según el acceso declarado, no según la herramienta disponible:

  1. White-box (gradiente): perturbaciones acotadas de norma fija (FGSM como baseline rápido, PGD multi-paso como referencia fuerte; la formulación de entrenamiento robusto de referencia es arXiv 1706.06083).
  2. Black-box (queries): ataques por decisión o por score sobre la interfaz publicada, con presupuesto de consultas fijado de antemano y contabilizado en el reporte.
  3. Transferencia: sustituto entrenado en laboratorio; mide cuánto del ataque migra al objetivo. Es una alternativa cuando no tenés acceso a gradientes del objetivo; no garantiza transferencia.
  4. Modelos de lenguaje (optimización discreta): sufijos adversariales optimizados (GCG, arXiv 2307.15043) mostraron ataques universales y transferibles contra LLMs alineados. En el playbook de PhiloCorp esta familia se evalúa solo sobre modelos de laboratorio, nunca como payload contra sistemas en uso.

Higiene de evaluación

El error clásico de este dominio es reportar robustez sobreestimada porque el ataque era débil. AutoAttack combina ataques complementarios y reduce el ajuste manual de sus hiperparámetros. Es una referencia útil para clasificadores y amenazas compatibles con su implementación. Igual tenés que fijar norma, presupuesto, acceso y versión; no se traslada sin adaptación a eventos tabulares o texto. Reglas mínimas:

  • Reportá robust accuracy como función del presupuesto (norma o queries), no un único número.
  • La evaluación debe incluir familias distintas a las usadas para entrenar o endurecer el modelo: evaluar solo con la configuración de PGD usada al entrenar puede sobreestimar robustez. Agregá ataques complementarios y, si la defensa transforma entradas, evaluá el pipeline completo.
  • Una muestra reproducible demuestra un contraejemplo; un conjunto permite estimar su frecuencia. Registrá tamaño, cobertura por clase e incertidumbre.
  • Definí denominadores: robust accuracy empírica es la fracción del conjunto que conserva una predicción correcta frente a los ataques ensayados. Para ASR, declaralo sobre muestras inicialmente correctas y válidas. El fracaso de esos ataques no certifica ausencia de otros.

Cómo evaluar de forma segura

  1. Definí amenaza y validez. Declará modalidad, clase objetivo, cambios permitidos, presupuesto de consultas y condición de conservación de significado.
  2. Medí la línea base. Registrá precisión limpia, distribución por clase y tasa de falsos negativos sobre corpus sintético.
  3. Aplicá familias apropiadas según el acceso, siempre dentro del presupuesto aprobado.
  4. Probá independencia entre familias de endurecimiento y de evaluación.
  5. Reportá efecto y costo. Incluí robust accuracy por escalón de presupuesto, ASR, consultas, cambios válidos, cobertura por clase y alertas generadas.

Marcador y resultado esperado

suite=PHILO-ROBUST-001
marker=PHILO_TEST_08_ROBUSTNESS
corpus=philocorp-synthetic-events
allowed_changes=3_nonsemantic_changes
query_budget=50
expected_result=ROBUSTNESS_TEST_COMPLETED

El marcador identifica la corrida; no es por sí mismo una perturbación adversarial. Definí qué tres cambios permite el dominio y cómo vas a validar que conservan significado. Las 50 consultas son un presupuesto de demostración, no una muestra suficiente para cualquier conclusión.

Límite de la prueba: usá solo el modelo y corpus de laboratorio autorizados, sin afectar decisiones reales. Abortá ante datos no sintéticos, pérdida de auditoría o exceso de consultas, tiempo o cómputo. Al terminar, restaurá corpus y configuración, y adjuntá métricas y hashes al Attack Intelligence Brief.

Criterios de verificación

  • Cada cambio conserva la validez definida por el dominio.
  • Se mide una tasa sobre conjunto, no una muestra aislada.
  • Se documenta acceso, presupuesto y alertas esperadas.
  • La robustez se reporta como curva frente al presupuesto, con familias de ataque declaradas.
  • La prueba no usa contenido operativo, sensible ni atribuible.

Remediación

Combiná entrenamiento adversarial frente a una amenaza definida, evaluación independiente, validación por dominio, abstención ante señales débiles, rate limiting y controles no ML para decisiones de alto impacto. No dependas de un único clasificador para autorizar o bloquear una acción crítica.

Práctica recomendada

AI Security Bootcamp, Day 6 (Adversarial ML): ejemplos adversariales por gradiente contra clasificadores de imágenes y optimización adversarial discreta y continua contra modelos de lenguaje. Licencia CC BY-NC-SA 4.0.

Evasión adversarial | PhiloCyber