C/01
Pentest de una aplicación LLM, antes de que fuera una categoría
Early mover · 2023
Situación
Un chatbot LLM de cara al público, a semanas del lanzamiento, construido para responder preguntas desde datos institucionales. El equipo había probado calidad y precisión — nadie lo había probado adversarialmente.
Restricción y anonimización
Anonimizado quitando geografía y detalle institucional; la fecha (principios de 2023) se mantiene a propósito — es el punto de este caso. Fue una de las primeras evaluaciones ofensivas sobre una aplicación LLM, unos dos años antes de que la mayoría de las firmas sumara “IA” a su página de pentesting.
Enfoque
- 01Autorización escrita con scope y un espejo no-productivo del chatbot antes de cualquier prueba
- 02Testing adversarial manual de la capa conversacional: prompt injection directa e indirecta, extracción del system prompt, exfiltración de datos a través del modelo
- 03Cada hallazgo candidato reproducido dos veces y encadenado a su impacto de negocio antes de entrar al reporte
Clases de hallazgos
- Caminos de prompt injection que anulaban las instrucciones del sistema y reorientaban al asistente
- Divulgación de información sensible: el modelo podía ser guiado a revelar datos fuera del alcance previsto
- Falta de manejo de salidas y de límites de tasa que convertía el mal comportamiento del modelo en riesgo para el usuario
Clases de resultado
- El lanzamiento salió sobre una superficie de ataque corregida en lugar de una sin probar
- Los hallazgos se convirtieron en el primer argumento concreto de la organización para una revisión de IA pre-lanzamiento
- Remediación validada en retest, con evidencia de cierre presentable ante stakeholders

