Del expediente al laboratorio
- Parte
- A
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 5 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Ya tenés una hipótesis. Ahora elegí dónde ponerla a prueba y qué evidencia querés traer de vuelta. Las misiones de este anexo son propuestas de PhiloCyber para acompañar la lectura.
La selección parte del catálogo de Arcanum y agrega ART para la ruta de ML. Cada enlace lleva al proyecto original. Documentación revisada el 2026-09-10; los recursos externos no se ejecutaron para esta edición. Las fichas ofrecen orientación, no instalaciones comprobadas.
Elegí tu recorrido
| Ruta | Secuencia | Entrega |
|---|---|---|
| Primera exploración | Gandalf / Agent Breaker, después PortSwigger | Una observación documentada y su límite |
| Agentes y herramientas | DVLA, DVMCP, después AgentDojo | Traza de propuesta, autorización y efecto |
| Medición y regresión | Elegí garak, PyRIT o promptfoo; ART para ML | Casos, configuración y comparación revisada |
Las herramientas de evaluación necesitan un objetivo preparado; su instalación no crea ese objetivo. Elegí una ficha, fijá versión y condiciones, y conservá la evidencia que permita reconstruir tu prueba.
Gandalf / Agent Breaker
Juego alojado · Entrada
Una primera conversación adversarial permite convertir intuiciones en hipótesis que puedas contrastar.
Abrir recurso: https://play.lakera.ai/agent-breaker
Preparación. Navegador; comprobá los desafíos y condiciones disponibles al entrar. El enlace original de Gandalf redirige a Agent Breaker.
Misión. Elegí un desafío disponible. Anotá el objetivo antes del primer intento y cambiá una sola variable entre dos consultas. Registrá también un intento que no funcione.
Traé al brief. Una página con objetivo, variante, respuesta visible y conclusión limitada a esa observación.
Límite. La interfaz puede no mostrar herramientas, política o efectos internos. No los deduzcas de la respuesta ni extrapoles completar un nivel a una evaluación empresarial.
Conecta con: Parte 04 · Parte 05. Estado: documentación revisada; ejecución no comprobada.
PortSwigger: Web LLM attacks
Laboratorios web · Entrada con base web
Permite seguir el salto desde una conversación hacia la aplicación que consume su resultado.
Abrir recurso: https://portswigger.net/web-security/llm-attacks
Preparación. Navegador y preparación indicada por el laboratorio de Web Security Academy que elijas.
Misión. Elegí un laboratorio del tema Web LLM attacks. Identificá entrada controlada, integración y efecto, y conservá una consulta legítima de referencia.
Traé al brief. Una cadena de entrada, componente, decisión y observación; marcá las etapas sin telemetría.
Límite. El objetivo del laboratorio delimita lo demostrado. Una solución no cubre todas las integraciones ni todos los riesgos del modelo.
Conecta con: Parte 04 · Parte 05. Estado: documentación revisada; ejecución no comprobada.
Damn Vulnerable LLM Agent
Agente vulnerable local · Intermedio
El agente ReAct permite estudiar cómo una instrucción puede influir sobre llamadas a herramientas y acceso a datos.
Abrir recurso: https://github.com/ReversecLabs/damn-vulnerable-llm-agent
Preparación. Python o Docker y modelo configurado; el README ofrece API y Ollama. Fijá commit y dependencias antes de instalar.
Misión. Compará una consulta legítima con una variante adversarial. Rastreá la identidad usada para pedir datos y la decisión del componente que los entrega.
Traé al brief. Dos trazas con identidad, herramienta, parámetros y datos sintéticos devueltos.
Límite. Compatibilidad y comportamiento dependen del modelo y las dependencias. Una traza ReAct expuesta por el laboratorio no equivale al razonamiento interno de cualquier modelo.
Conecta con: Parte 05. Estado: documentación revisada; ejecución no comprobada.
Damn Vulnerable MCP Server
Servidor vulnerable local · Intermedio
Relaciona el catálogo de herramientas con decisiones observables en una implementación de MCP.
Abrir recurso: https://github.com/harishsg993010/damn-vulnerable-MCP-server
Preparación. El proyecto recomienda Docker/Linux y señala limitaciones en Windows nativo. Registrá transporte, SDK y commit.
Misión. Elegí un desafío de tool poisoning. Guardá la descripción de la herramienta antes de la consulta y seguí su influencia hasta una selección o invocación observable.
Traé al brief. Catálogo, origen del contenido controlado, consulta, traza y límite del hallazgo.
Límite. No asumas que el transporte o la versión del laboratorio coinciden con la edición MCP de esta guía. Compará la implementación concreta.
Conecta con: Parte 06. Estado: documentación revisada; ejecución no comprobada.
AgentDojo
Entorno de evaluación · Avanzado
Permite comparar ataques y defensas sobre tareas de agentes, considerando la tarea legítima.
Abrir recurso: https://github.com/ethz-spylab/agentdojo
Preparación. Python, modelo y configuración de benchmark. La API del paquete puede cambiar; fijá versión, tareas y presupuesto.
Misión. Elegí un conjunto pequeño de tareas. Compará la misma configuración con y sin una defensa, manteniendo las entradas y registrando las repeticiones.
Traé al brief. Configuración, resultados por tarea, éxito del ataque y cumplimiento legítimo, con revisión de ejemplos.
Límite. El conjunto elegido no representa toda la aplicación de PhiloCorp. Cero éxitos en la muestra no garantiza ausencia de variantes.
Conecta con: Parte 05 · Parte 10 · Parte 11. Estado: documentación revisada; ejecución no comprobada.
Adversarial Robustness Toolbox
Biblioteca de seguridad de ML · Base de ML requerida
Conecta la lectura sobre evasión con medidas de desempeño de un clasificador bajo un presupuesto explícito.
Abrir recurso: https://github.com/Trusted-AI/adversarial-robustness-toolbox
Preparación. Python, framework compatible, modelo y datos. Esta selección complementa el catálogo de Arcanum con la ruta de ML.
Misión. Prepará un clasificador pequeño y un conjunto de evaluación separado. Compará desempeño limpio y bajo evasión, declarando conocimiento del adversario y perturbación permitida.
Traé al brief. Dataset y particiones identificados, configuración del ataque, presupuesto y comparación por clase.
Límite. No confundas accuracy bajo una configuración con robustez universal; conservá los ejemplos donde la perturbación deja de ser válida.
Conecta con: Parte 08 · Parte 10. Estado: documentación revisada; ejecución no comprobada.
garak
Scanner de LLMs · Intermedio
Ayuda a aprender cómo pasar de un resultado automático a una observación revisada.
Abrir recurso: https://github.com/NVIDIA/garak
Preparación. Python y un modelo o endpoint de prueba. Seleccioná probes y fijá un presupuesto antes de ejecutar.
Misión. Elegí una capacidad concreta. Revisá manualmente un resultado señalado y uno no señalado, usando la misma rúbrica.
Traé al brief. Probes, detectores, configuración y dos ejemplos con tu interpretación de la salida.
Límite. El scanner necesita un objetivo y su detector puede equivocarse. Su reporte no sustituye verificar el impacto en la aplicación.
Conecta con: Parte 04 · Parte 10. Estado: documentación revisada; ejecución no comprobada.
PyRIT
Framework de evaluación · Avanzado
Permite organizar experimentos de identificación de riesgos en sistemas generativos.
Abrir recurso: https://github.com/microsoft/PyRIT
Preparación. Seguí la instalación de la versión elegida y configurá objetivos y evaluadores. El repositorio actual pertenece a Microsoft.
Misión. Prepará un experimento acotado con dos variantes y una rúbrica compartida. Guardá los resultados que requieran revisión humana.
Traé al brief. Configuración, entradas, evaluación y desacuerdos entre el evaluador automático y tu revisión.
Límite. Automatizar más intentos no corrige una rúbrica equivocada. El consumo depende de los modelos y del procedimiento.
Conecta con: Parte 04 · Parte 05 · Parte 10. Estado: documentación revisada; ejecución no comprobada.
promptfoo
Evaluación y regresión · Intermedio
Permite convertir un hallazgo en casos que vuelvan a comprobarse cuando cambia el sistema.
Abrir recurso: https://www.promptfoo.dev/docs/red-team/
Preparación. Runtime y configuración indicados por la documentación, más una aplicación o modelo objetivo. Identificá proveedores y consumo.
Misión. Convertí un hallazgo del expediente en una prueba adversarial y una legítima. Compará dos configuraciones con criterios definidos de antemano.
Traé al brief. Casos, configuración y reporte antes/después, con observaciones revisadas.
Límite. Un evaluador de texto no demuestra por sí solo que una herramienta se ejecutó. Incorporá la evidencia de la aplicación cuando esa sea la afirmación.
Conecta con: Parte 10 · Parte 11. Estado: documentación revisada; ejecución no comprobada.

