Ataques de privacidad y extracción de modelos
- Parte
- 08
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 3 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Superficie: Modelo e interfaz de inferencia ATLAS: AML.T0024 (Exfiltration via AI Inference API) OWASP: ML03:2023 Model Inversion Attack, ML04:2023 Membership Inference Attack, ML05:2023 Model Theft (ML Top 10, draft 2023) Riesgo: Alto
Qué importa
La API de PhiloCorp devuelve una respuesta pequeña. Eso no significa que revele poca información después de muchas consultas. Acá vas a separar dos preguntas: qué permite inferir sobre los datos de entrenamiento y cuánto ayuda a aproximar el comportamiento del modelo.
NIST AI 100-2e2025 distingue estas técnicas: membership inference (NISTAML.033) estima si un registro participó en entrenamiento; reconstruction (NISTAML.032) intenta reconstruir atributos o registros; property inference (NISTAML.034) estima propiedades agregadas del dataset; model extraction (NISTAML.031) aproxima la función del modelo. La evidencia debe usar exclusivamente datos sintéticos de PhiloCorp.
Cómo evaluar de forma segura
- Definí acceso y unidad protegida. Documentá si la API devuelve etiqueta, probabilidad, logits, embedding o texto, y qué representa un registro de laboratorio.
- Fijá un presupuesto autorizado. Establecé cantidad de consultas, ventana, identidad de prueba y condición de detención antes de evaluar.
- Elegí una auditoría de membership compatible con el acceso. Shokri et al. (arXiv 1610.05820) y LiRA son referencias para diseñarla. LiRA requiere señales y modelos de referencia que no se obtienen automáticamente de una API label-only. Documentá qué variante podés implementar y sus precondiciones. La diferencia práctica importa: reportá TPR a FPR bajo (por ejemplo TPR con FPR de 0.1%) además de AUC. Un AUC mediocre puede ocultar una tasa de detección relevante en una fracción pequeña de registros. Usá conjuntos sintéticos separados de entrenamiento y holdout, y reportá intervalo de confianza.
- Auditá extracción por fidelidad. Knockoff Nets (arXiv 1812.02766) demostró robo de funcionalidad en régimen completamente black-box, solo con queries. Compará un sustituto de laboratorio con el objetivo solo sobre datos sintéticos y medí acuerdo de predicción y consultas consumidas. No recuperes pesos ni datos. El acceso label-only no es defensa suficiente: reduce la información por consulta, pero no garantiza impedir una aproximación útil.
- Validá telemetría. Confirmá que cuota, rate limit y alertas detectan patrones anómalos sin bloquear el uso legítimo acordado.
Marcador y resultado esperado
suite=PHILO-PRIVACY-001
marker=PHILO_TEST_08_PRIVACY
dataset=philocorp-synthetic-heldout
query_budget=50
output_mode=label-only
expected_evidence=PRIVACY_AUDIT_COMPLETEDEl bloque representa una prueba breve de acceso y telemetría. Con 50 consultas compartidas no podés caracterizar de forma fiable una FPR de 0.1%: incluso con 1.000 no miembros, un solo falso positivo ya representa esa tasa. Una auditoría estadística exige otro tamaño de muestra y un presupuesto aprobado de antemano. Si no lo tenés, reportá «evidencia insuficiente» para esa métrica.
Límite de la prueba: consultá solo la API de laboratorio con identidades y registros sintéticos; no recuperes pesos ni contenido privado. Abortá ante salidas no aprobadas, datos reales, pérdida de auditoría o exceso de presupuesto. Cerrá las sesiones y conservá las particiones y parámetros necesarios para reproducir la comparación.
Métricas y límites
- Membership inference: TPR@FPR bajo, AUC, ventaja e intervalo de confianza.
- Extracción: acuerdo de etiquetas y consultas consumidas por nivel de acceso (label, probabilidad, logits).
- Operación: alertas, bloqueos correctos y falsos positivos.
La privacidad diferencial protege contribuciones individuales bajo una definición y configuración documentadas; no protege secretos de runtime en RAG ni impide por sí sola el robo funcional de IP.
Remediación
Reducí granularidad de salida, aplicá autenticación y cuotas por identidad, detectá automatización y registrá consultas. Para datos de entrenamiento, evaluá DP-SGD o PATE con epsilon, delta, accountant, unidad protegida y utilidad por release. Para extracción, agregá controles de acceso, monitoreo y protección de propiedad intelectual; no atribuyas ese problema exclusivamente a DP. Adjuntá al Attack Intelligence Brief el acceso observado, las métricas estimables y las preguntas que la muestra dejó abiertas.
Práctica recomendada
AI Security Bootcamp, Day 3 (LLM Inference Security): extracción de modelos y ataques de destilación de conocimiento contra APIs desplegadas. Licencia CC BY-NC-SA 4.0.

