Saltar al contenido
PhiloCyber logo
Índice de la guía

Del expediente al laboratorio

Parte
A
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
5 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

Ya tenés una hipótesis. Ahora elegí dónde ponerla a prueba y qué evidencia querés traer de vuelta. Las misiones de este anexo son propuestas de PhiloCyber para acompañar la lectura.

La selección parte del catálogo de Arcanum y agrega ART para la ruta de ML. Cada enlace lleva al proyecto original. Documentación revisada el 2026-09-10; los recursos externos no se ejecutaron para esta edición. Las fichas ofrecen orientación, no instalaciones comprobadas.

Elegí tu recorrido

RutaSecuenciaEntrega
Primera exploraciónGandalf / Agent Breaker, después PortSwiggerUna observación documentada y su límite
Agentes y herramientasDVLA, DVMCP, después AgentDojoTraza de propuesta, autorización y efecto
Medición y regresiónElegí garak, PyRIT o promptfoo; ART para MLCasos, configuración y comparación revisada

Las herramientas de evaluación necesitan un objetivo preparado; su instalación no crea ese objetivo. Elegí una ficha, fijá versión y condiciones, y conservá la evidencia que permita reconstruir tu prueba.

Gandalf / Agent Breaker

Juego alojado · Entrada

Una primera conversación adversarial permite convertir intuiciones en hipótesis que puedas contrastar.

Abrir recurso: https://play.lakera.ai/agent-breaker

Preparación. Navegador; comprobá los desafíos y condiciones disponibles al entrar. El enlace original de Gandalf redirige a Agent Breaker.

Misión. Elegí un desafío disponible. Anotá el objetivo antes del primer intento y cambiá una sola variable entre dos consultas. Registrá también un intento que no funcione.

Traé al brief. Una página con objetivo, variante, respuesta visible y conclusión limitada a esa observación.

Límite. La interfaz puede no mostrar herramientas, política o efectos internos. No los deduzcas de la respuesta ni extrapoles completar un nivel a una evaluación empresarial.

Conecta con: Parte 04 · Parte 05. Estado: documentación revisada; ejecución no comprobada.

PortSwigger: Web LLM attacks

Laboratorios web · Entrada con base web

Permite seguir el salto desde una conversación hacia la aplicación que consume su resultado.

Abrir recurso: https://portswigger.net/web-security/llm-attacks

Preparación. Navegador y preparación indicada por el laboratorio de Web Security Academy que elijas.

Misión. Elegí un laboratorio del tema Web LLM attacks. Identificá entrada controlada, integración y efecto, y conservá una consulta legítima de referencia.

Traé al brief. Una cadena de entrada, componente, decisión y observación; marcá las etapas sin telemetría.

Límite. El objetivo del laboratorio delimita lo demostrado. Una solución no cubre todas las integraciones ni todos los riesgos del modelo.

Conecta con: Parte 04 · Parte 05. Estado: documentación revisada; ejecución no comprobada.

Damn Vulnerable LLM Agent

Agente vulnerable local · Intermedio

El agente ReAct permite estudiar cómo una instrucción puede influir sobre llamadas a herramientas y acceso a datos.

Abrir recurso: https://github.com/ReversecLabs/damn-vulnerable-llm-agent

Preparación. Python o Docker y modelo configurado; el README ofrece API y Ollama. Fijá commit y dependencias antes de instalar.

Misión. Compará una consulta legítima con una variante adversarial. Rastreá la identidad usada para pedir datos y la decisión del componente que los entrega.

Traé al brief. Dos trazas con identidad, herramienta, parámetros y datos sintéticos devueltos.

Límite. Compatibilidad y comportamiento dependen del modelo y las dependencias. Una traza ReAct expuesta por el laboratorio no equivale al razonamiento interno de cualquier modelo.

Conecta con: Parte 05. Estado: documentación revisada; ejecución no comprobada.

Damn Vulnerable MCP Server

Servidor vulnerable local · Intermedio

Relaciona el catálogo de herramientas con decisiones observables en una implementación de MCP.

Abrir recurso: https://github.com/harishsg993010/damn-vulnerable-MCP-server

Preparación. El proyecto recomienda Docker/Linux y señala limitaciones en Windows nativo. Registrá transporte, SDK y commit.

Misión. Elegí un desafío de tool poisoning. Guardá la descripción de la herramienta antes de la consulta y seguí su influencia hasta una selección o invocación observable.

Traé al brief. Catálogo, origen del contenido controlado, consulta, traza y límite del hallazgo.

Límite. No asumas que el transporte o la versión del laboratorio coinciden con la edición MCP de esta guía. Compará la implementación concreta.

Conecta con: Parte 06. Estado: documentación revisada; ejecución no comprobada.

AgentDojo

Entorno de evaluación · Avanzado

Permite comparar ataques y defensas sobre tareas de agentes, considerando la tarea legítima.

Abrir recurso: https://github.com/ethz-spylab/agentdojo

Preparación. Python, modelo y configuración de benchmark. La API del paquete puede cambiar; fijá versión, tareas y presupuesto.

Misión. Elegí un conjunto pequeño de tareas. Compará la misma configuración con y sin una defensa, manteniendo las entradas y registrando las repeticiones.

Traé al brief. Configuración, resultados por tarea, éxito del ataque y cumplimiento legítimo, con revisión de ejemplos.

Límite. El conjunto elegido no representa toda la aplicación de PhiloCorp. Cero éxitos en la muestra no garantiza ausencia de variantes.

Conecta con: Parte 05 · Parte 10 · Parte 11. Estado: documentación revisada; ejecución no comprobada.

Adversarial Robustness Toolbox

Biblioteca de seguridad de ML · Base de ML requerida

Conecta la lectura sobre evasión con medidas de desempeño de un clasificador bajo un presupuesto explícito.

Abrir recurso: https://github.com/Trusted-AI/adversarial-robustness-toolbox

Preparación. Python, framework compatible, modelo y datos. Esta selección complementa el catálogo de Arcanum con la ruta de ML.

Misión. Prepará un clasificador pequeño y un conjunto de evaluación separado. Compará desempeño limpio y bajo evasión, declarando conocimiento del adversario y perturbación permitida.

Traé al brief. Dataset y particiones identificados, configuración del ataque, presupuesto y comparación por clase.

Límite. No confundas accuracy bajo una configuración con robustez universal; conservá los ejemplos donde la perturbación deja de ser válida.

Conecta con: Parte 08 · Parte 10. Estado: documentación revisada; ejecución no comprobada.

garak

Scanner de LLMs · Intermedio

Ayuda a aprender cómo pasar de un resultado automático a una observación revisada.

Abrir recurso: https://github.com/NVIDIA/garak

Preparación. Python y un modelo o endpoint de prueba. Seleccioná probes y fijá un presupuesto antes de ejecutar.

Misión. Elegí una capacidad concreta. Revisá manualmente un resultado señalado y uno no señalado, usando la misma rúbrica.

Traé al brief. Probes, detectores, configuración y dos ejemplos con tu interpretación de la salida.

Límite. El scanner necesita un objetivo y su detector puede equivocarse. Su reporte no sustituye verificar el impacto en la aplicación.

Conecta con: Parte 04 · Parte 10. Estado: documentación revisada; ejecución no comprobada.

PyRIT

Framework de evaluación · Avanzado

Permite organizar experimentos de identificación de riesgos en sistemas generativos.

Abrir recurso: https://github.com/microsoft/PyRIT

Preparación. Seguí la instalación de la versión elegida y configurá objetivos y evaluadores. El repositorio actual pertenece a Microsoft.

Misión. Prepará un experimento acotado con dos variantes y una rúbrica compartida. Guardá los resultados que requieran revisión humana.

Traé al brief. Configuración, entradas, evaluación y desacuerdos entre el evaluador automático y tu revisión.

Límite. Automatizar más intentos no corrige una rúbrica equivocada. El consumo depende de los modelos y del procedimiento.

Conecta con: Parte 04 · Parte 05 · Parte 10. Estado: documentación revisada; ejecución no comprobada.

promptfoo

Evaluación y regresión · Intermedio

Permite convertir un hallazgo en casos que vuelvan a comprobarse cuando cambia el sistema.

Abrir recurso: https://www.promptfoo.dev/docs/red-team/

Preparación. Runtime y configuración indicados por la documentación, más una aplicación o modelo objetivo. Identificá proveedores y consumo.

Misión. Convertí un hallazgo del expediente en una prueba adversarial y una legítima. Compará dos configuraciones con criterios definidos de antemano.

Traé al brief. Casos, configuración y reporte antes/después, con observaciones revisadas.

Límite. Un evaluador de texto no demuestra por sí solo que una herramienta se ejecutó. Incorporá la evidencia de la aplicación cuando esa sea la afirmación.

Conecta con: Parte 10 · Parte 11. Estado: documentación revisada; ejecución no comprobada.

Del expediente al laboratorio | PhiloCyber