Parte 07 - Evaluación de seguridad RAG y embeddings
- Parte
- 07
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 2 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
El documento que nadie recordaba haber aprobado
En el escenario ficticio de PhiloCorp, un procedimiento sintético aparece entre los resultados del Knowledge Agent. Tiene el formato correcto, un título verosímil y una instrucción que intenta convertir recuperación en autorización. Producto cree que llegó desde soporte; soporte cree que sólo indexa documentos aprobados. El pipeline no puede demostrar ninguna de las dos versiones.
Como consultor externo, retrocedés desde la respuesta hasta el chunk, el embedding, la fuente y la decisión de ingesta. Cada salto agrega o pierde contexto de confianza. La respuesta alterada nos lleva a una pregunta anterior: cómo pudo un objeto sin procedencia competir con conocimiento aprobado y qué control debía revisar su incorporación al corpus.
| Tema | Qué vas a comprobar |
|---|---|
| Integridad del contexto recuperado | Contexto no confiable, procedencia y denegación |
| Integridad de la ingesta RAG | Fuentes aprobadas y cuarentena |
| Aislamiento de conocimiento y controles de salida | Tenant, mínimo dato y deny logs |
| Riesgo de reconstrucción desde embeddings | Evaluación offline de marcadores de prueba |
| Aislamiento de vector DB | Namespace, cuotas y trazabilidad |
| Laboratorio de procedencia y aislamiento | Práctica con datos sintéticos |
Medí recuperación, procedencia, aislamiento, influencia y bloqueo sin datos reales ni exportaciones masivas. La reconstrucción desde embeddings no es una recuperación garantizada.
PoisonedRAG y AgentPoison muestran que una modificación pequeña del corpus puede afectar respuestas bajo condiciones experimentales específicas. La medida que nos importa acá sale del laboratorio de PhiloCorp: qué se incorporó, qué se recuperó y qué cambió en la respuesta. Los estudios orientan la hipótesis; no reemplazan esa evidencia.
Condiciones de detención: contenido fuera del corpus sintético, fallo de tenant, escritura no aprobada, salida de red o una consulta que exceda la muestra acordada.
Al cerrar esta parte, el Attack Intelligence Brief conecta cada respuesta evaluada con sus fuentes, permisos y versiones. Esa cadena permite avanzar hacia modelos y entrenamiento sin confundir poisoning durante la recuperación con una modificación de los pesos del modelo.
Una decisión antes de seguir
Un chunk adversarial aparece en el contexto, pero la respuesta sigue siendo correcta. ¿Demostraste retrieval hijacking y obediencia?
Anotá qué afirmarías y qué observación falta. Contrastá tu respuesta.
El expediente avanza. El corpus explica parte de la conducta; otras hipótesis requieren mirar entrenamiento y modelo.

