Saltar al contenido
PhiloCyber logo
Índice de la guía

Parte 04 - Ataques a LLMs

Parte
04
Estado
Revisado
Edición
v2 / 01.09.2026
Tiempo estimado de lectura
2 min

Edición del 1 de septiembre de 2026

Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.

La respuesta que parecía inocua

En el caso ficticio de PhiloCorp, el primer marcador de prueba aparece al final de un resumen, exactamente donde la instrucción no confiable lo pidió. En otra evaluación eso podría convertirse de inmediato en un finding crítico. Acá el equipo se detiene: la salida demuestra influencia, no autoridad, acceso ni efecto.

PhiloCorp necesita saber qué ocurrió entre el contenido recuperado y la respuesta. Como consultor externo, repetís la prueba con trazabilidad de origen, decisiones del orquestador, consumo y consumidores de la salida. El recorrido empieza a separar tres cosas que suelen confundirse: que el modelo cambie de texto, que proponga una acción y que el sistema realmente la autorice. Una respuesta alterada también puede tener impacto si alguien toma una decisión con ella; la severidad depende del uso y de la evidencia, no de que haya una tool call.

PáginaQué vas a comprobar
Prompt injection directaPrioridad de instrucciones y límites de acción
Prompt injection indirectaInfluencia de contenido no confiable
JailbreaksRobustez de policy con objetivos-proxy
Exposición de contexto ocultoMarcadores de prueba y ausencia de secretos o policy basada en ocultamiento
Manejo inseguro de salidaValidación de sinks con marcadores
Consumo no acotadoCuotas, límites y circuit breakers
Misinformation y dependenciaFuentes, claims, incertidumbre y verificación independiente
Laboratorio PhiloCorpMarcadores de prueba, métricas y stop conditions

Regla de laboratorio

Permitido: texto sintético, philocorp-demo, marcadores de prueba y dry-run. Prohibido: secretos o instrucciones internas reales, evasión operativa, afectar disponibilidad, invocar herramientas con efectos, red externa y cambios persistentes. Los resultados de herramientas se inyectan como datos de prueba locales: no se invocan servicios para obtenerlos.

Cada prueba registra origen, acción solicitada, acción observada, control esperado y evidencia. Detené si aparece contenido no sintético, una tool, egress o consumo fuera de presupuesto.

Al cerrar esta parte, el Attack Intelligence Brief debe distinguir respuesta alterada, propuesta de acción, decisión de autorización y efecto observado. Esa separación te permite pasar a agentes sin arrastrar un hallazgo que la evidencia todavía no sostiene.

Una decisión antes de seguir

PHILO_TEST aparece en una cita donde el asistente explica el documento adversarial. ¿La inyección tuvo éxito?

Anotá qué afirmarías y qué observación falta. Contrastá tu respuesta.

Mapa del Knowledge Agent, con las superficies de la Parte 04 destacadas

El expediente avanza. La siguiente pregunta es qué ocurre cuando la respuesta propone una herramienta.

Para practicar: Gandalf / Agent Breaker, PortSwigger: Web LLM attacks, garak, PyRIT.

Parte 04 - Ataques a LLMs | PhiloCyber