Entrenamiento adversarial y evaluación robusta
- Parte
- 10
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 2 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
ATLAS (mitigaciones): AML.M0003 (Predictive AI Model Hardening), AML.M0015 (Predictive AI Adversarial Input Detection), AML.M0006 (Predictive AI Ensembles)
El modelo corregido supera todos los ejemplos que lo hicieron fallar. Buen comienzo. Ahora necesitás saber si aprendió a resistir la amenaza o si solo aprendió esa colección de ejemplos. Esa es la pregunta que PhiloCorp lleva a la nueva evaluación.
El entrenamiento adversarial busca mejorar la resistencia frente a una amenaza definida. Su beneficio depende de la tarea, el procedimiento y los ataques evaluados; puede tener costos de utilidad y cómputo. Una mejora en una modalidad no se extrapola a otra.
Para clasificadores
Definí modalidad, norma o conjunto de cambios, presupuesto y validez funcional. Separá entrenamiento, selección de hiperparámetros y evaluación final. Evaluar con PGD después de entrenar con PGD sigue aportando evidencia, pero usar solo la misma configuración puede ocultar debilidades.
AutoAttack combina ataques complementarios con menor necesidad de ajuste manual y es una referencia para amenazas compatibles con su implementación. No elimina la elección de norma, presupuesto, acceso o versión. Si la defensa transforma entradas o usa aleatoriedad, evaluá el sistema completo y declaralo; si trabajás con texto o eventos tabulares, elegí métodos que respeten su semántica.
Reportá precisión limpia, robust accuracy empírica por escalón de presupuesto, cobertura por clase, abstenciones y costo. La ausencia de ejemplos adversariales encontrados no certifica robustez: expresa el resultado de una búsqueda acotada.
Para sistemas generativos
Usá conjuntos sintéticos de regresión para instrucciones conflictivas, contenido recuperado no confiable y solicitudes benignas. Mantené casos de evaluación que no se hayan usado para el ajuste. Medí rechazo correcto, rechazo excesivo, comportamiento por idioma y autorización de herramientas. Registrá variabilidad entre ejecuciones. El ajuste de seguridad complementa el control externo de acciones; la aprobación de una respuesta no debe ampliar los permisos del agente.
Criterio de aceptación
release=philocorp-lab-model-03
threat_model=<versioned>
clean_accuracy=<measured_with_sample_size>
robust_accuracy=<measured_by_budget_and_attack_family>
abstention_rate=<measured>
over_refusal=<measured_for_generative_tasks>
evaluation_split=<held_out_id_and_hash>
acceptance_thresholds=<agreed_before_evaluation>Fijá los umbrales antes de comparar releases. Corré el ensayo solo sobre copias y datos sintéticos, con presupuesto de consultas y cómputo; abortá ante datos reales, consumo excedido o efectos fuera de alcance. Restaurá la versión de referencia al terminar.
El Attack Intelligence Brief debe conservar la mejora y su costo. Si el modelo reduce fallos adversariales bloqueando gran parte del uso legítimo, esa pérdida también forma parte de la decisión de promoción.

