Parte 04 - Ataques a LLMs
- Parte
- 04
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 2 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
La respuesta que parecía inocua
En el caso ficticio de PhiloCorp, el primer marcador de prueba aparece al final de un resumen, exactamente donde la instrucción no confiable lo pidió. En otra evaluación eso podría convertirse de inmediato en un finding crítico. Acá el equipo se detiene: la salida demuestra influencia, no autoridad, acceso ni efecto.
PhiloCorp necesita saber qué ocurrió entre el contenido recuperado y la respuesta. Como consultor externo, repetís la prueba con trazabilidad de origen, decisiones del orquestador, consumo y consumidores de la salida. El recorrido empieza a separar tres cosas que suelen confundirse: que el modelo cambie de texto, que proponga una acción y que el sistema realmente la autorice. Una respuesta alterada también puede tener impacto si alguien toma una decisión con ella; la severidad depende del uso y de la evidencia, no de que haya una tool call.
| Página | Qué vas a comprobar |
|---|---|
| Prompt injection directa | Prioridad de instrucciones y límites de acción |
| Prompt injection indirecta | Influencia de contenido no confiable |
| Jailbreaks | Robustez de policy con objetivos-proxy |
| Exposición de contexto oculto | Marcadores de prueba y ausencia de secretos o policy basada en ocultamiento |
| Manejo inseguro de salida | Validación de sinks con marcadores |
| Consumo no acotado | Cuotas, límites y circuit breakers |
| Misinformation y dependencia | Fuentes, claims, incertidumbre y verificación independiente |
| Laboratorio PhiloCorp | Marcadores de prueba, métricas y stop conditions |
Regla de laboratorio
Permitido: texto sintético, philocorp-demo, marcadores de prueba y dry-run.
Prohibido: secretos o instrucciones internas reales, evasión operativa, afectar disponibilidad,
invocar herramientas con efectos, red externa y cambios persistentes. Los resultados de herramientas
se inyectan como datos de prueba locales: no se invocan servicios para obtenerlos.
Cada prueba registra origen, acción solicitada, acción observada, control esperado y evidencia. Detené si aparece contenido no sintético, una tool, egress o consumo fuera de presupuesto.
Al cerrar esta parte, el Attack Intelligence Brief debe distinguir respuesta alterada, propuesta de acción, decisión de autorización y efecto observado. Esa separación te permite pasar a agentes sin arrastrar un hallazgo que la evidencia todavía no sostiene.
Una decisión antes de seguir
PHILO_TEST aparece en una cita donde el asistente explica el documento adversarial. ¿La inyección tuvo éxito?
Anotá qué afirmarías y qué observación falta. Contrastá tu respuesta.
El expediente avanza. La siguiente pregunta es qué ocurre cuando la respuesta propone una herramienta.
Para practicar: Gandalf / Agent Breaker, PortSwigger: Web LLM attacks, garak, PyRIT.

