Saltar al contenido
PhiloCyber logo
Índice de la guía

Ataques de privacidad y extracción de modelos

Parte
08
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
3 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

Superficie: Modelo e interfaz de inferencia ATLAS: AML.T0024 (Exfiltration via AI Inference API) OWASP: ML03:2023 Model Inversion Attack, ML04:2023 Membership Inference Attack, ML05:2023 Model Theft (ML Top 10, draft 2023) Riesgo: Alto

Qué importa

La API de PhiloCorp devuelve una respuesta pequeña. Eso no significa que revele poca información después de muchas consultas. Acá vas a separar dos preguntas: qué permite inferir sobre los datos de entrenamiento y cuánto ayuda a aproximar el comportamiento del modelo.

NIST AI 100-2e2025 distingue estas técnicas: membership inference (NISTAML.033) estima si un registro participó en entrenamiento; reconstruction (NISTAML.032) intenta reconstruir atributos o registros; property inference (NISTAML.034) estima propiedades agregadas del dataset; model extraction (NISTAML.031) aproxima la función del modelo. La evidencia debe usar exclusivamente datos sintéticos de PhiloCorp.

Cómo evaluar de forma segura

  1. Definí acceso y unidad protegida. Documentá si la API devuelve etiqueta, probabilidad, logits, embedding o texto, y qué representa un registro de laboratorio.
  2. Fijá un presupuesto autorizado. Establecé cantidad de consultas, ventana, identidad de prueba y condición de detención antes de evaluar.
  3. Elegí una auditoría de membership compatible con el acceso. Shokri et al. (arXiv 1610.05820) y LiRA son referencias para diseñarla. LiRA requiere señales y modelos de referencia que no se obtienen automáticamente de una API label-only. Documentá qué variante podés implementar y sus precondiciones. La diferencia práctica importa: reportá TPR a FPR bajo (por ejemplo TPR con FPR de 0.1%) además de AUC. Un AUC mediocre puede ocultar una tasa de detección relevante en una fracción pequeña de registros. Usá conjuntos sintéticos separados de entrenamiento y holdout, y reportá intervalo de confianza.
  4. Auditá extracción por fidelidad. Knockoff Nets (arXiv 1812.02766) demostró robo de funcionalidad en régimen completamente black-box, solo con queries. Compará un sustituto de laboratorio con el objetivo solo sobre datos sintéticos y medí acuerdo de predicción y consultas consumidas. No recuperes pesos ni datos. El acceso label-only no es defensa suficiente: reduce la información por consulta, pero no garantiza impedir una aproximación útil.
  5. Validá telemetría. Confirmá que cuota, rate limit y alertas detectan patrones anómalos sin bloquear el uso legítimo acordado.

Marcador y resultado esperado

suite=PHILO-PRIVACY-001
marker=PHILO_TEST_08_PRIVACY
dataset=philocorp-synthetic-heldout
query_budget=50
output_mode=label-only
expected_evidence=PRIVACY_AUDIT_COMPLETED

El bloque representa una prueba breve de acceso y telemetría. Con 50 consultas compartidas no podés caracterizar de forma fiable una FPR de 0.1%: incluso con 1.000 no miembros, un solo falso positivo ya representa esa tasa. Una auditoría estadística exige otro tamaño de muestra y un presupuesto aprobado de antemano. Si no lo tenés, reportá «evidencia insuficiente» para esa métrica.

Límite de la prueba: consultá solo la API de laboratorio con identidades y registros sintéticos; no recuperes pesos ni contenido privado. Abortá ante salidas no aprobadas, datos reales, pérdida de auditoría o exceso de presupuesto. Cerrá las sesiones y conservá las particiones y parámetros necesarios para reproducir la comparación.

Métricas y límites

  • Membership inference: TPR@FPR bajo, AUC, ventaja e intervalo de confianza.
  • Extracción: acuerdo de etiquetas y consultas consumidas por nivel de acceso (label, probabilidad, logits).
  • Operación: alertas, bloqueos correctos y falsos positivos.

La privacidad diferencial protege contribuciones individuales bajo una definición y configuración documentadas; no protege secretos de runtime en RAG ni impide por sí sola el robo funcional de IP.

Remediación

Reducí granularidad de salida, aplicá autenticación y cuotas por identidad, detectá automatización y registrá consultas. Para datos de entrenamiento, evaluá DP-SGD o PATE con epsilon, delta, accountant, unidad protegida y utilidad por release. Para extracción, agregá controles de acceso, monitoreo y protección de propiedad intelectual; no atribuyas ese problema exclusivamente a DP. Adjuntá al Attack Intelligence Brief el acceso observado, las métricas estimables y las preguntas que la muestra dejó abiertas.

Práctica recomendada

AI Security Bootcamp, Day 3 (LLM Inference Security): extracción de modelos y ataques de destilación de conocimiento contra APIs desplegadas. Licencia CC BY-NC-SA 4.0.

Ataques de privacidad y extracción de modelos | PhiloCyber