Vocabulario mínimo ML/DL/GenAI
- Parte
- 01
- Estado
- Revisado
- Edición
- v2 / 01.09.2026
- Tiempo estimado de lectura
- 4 min
Edición del 1 de septiembre de 2026
Las fuentes conservan sus fechas de consulta. El laboratorio identifica la simulación determinística y la integración con modelo por separado.
Tipo: Referencia · Fase: Orientación
«El modelo tiene acceso a la base». En una reunión esa frase pasa rápido; en una prueba deja varias dudas. ¿El modelo consulta directamente? ¿El agente llama una herramienta? ¿Qué identidad usa esa herramienta? Acá vamos a ponerle nombre a esas diferencias.
Leé este vocabulario como apoyo al mapa de PhiloCorp. No hace falta memorizarlo: volvé cuando un término cambie lo que estás a punto de probar. Las definiciones ampliadas están en el glosario.
Términos base
- Modelo. Función entrenada que mapea entradas a salidas (una clasificación, un texto). Un modelo generativo produce texto, imágenes, audio u otros contenidos.
- Pesos (weights). Los parámetros aprendidos del modelo. Son uno de varios artefactos de alto valor junto con corpus, credenciales, políticas, evaluaciones e identidades.
- Entrenamiento vs inferencia. Entrenar produce los pesos; inferir es usar el modelo ya entrenado. Muchos ataques ocurren en inferencia (evasión, injection); otros en entrenamiento (poisoning).
- Fine-tuning. Ajustar parámetros de un modelo ya entrenado con datos adicionales. LoRA aprende actualizaciones de bajo rango manteniendo congelados los pesos base; los adaptadores resultantes también forman parte de la supply chain.
GenAI y LLMs
- Token. Unidad de representación del texto: puede corresponder a una palabra, un fragmento, un signo u otra secuencia, según el tokenizer. No equivale a una cantidad fija de caracteres. El tokenizer convierte texto a identificadores; su integridad importa como la de otros artefactos.
- Embedding. Vector denso que representa un texto/dato. Puede filtrar información o habilitar reconstrucción según el modelo, acceso auxiliar y corpus; no asumir inversión automática.
- Contexto / context window. La información que el modelo puede procesar en una interacción, incluidos mensajes y contenido recuperado; puede contener modalidades distintas del texto. El límite se expresa según el modelo y la API, y puede compartir presupuesto con la salida.
- System prompt. Instrucciones de configuración presentadas con un rol o prioridad definidos por la interfaz. Su ubicación al principio no es por sí sola una frontera de seguridad. Puede ser objeto de exposición o de intentos de alterar su efecto.
- Temperatura. Parámetro que modifica la distribución usada al muestrear tokens. Puede cambiar la variación de las salidas, junto con otros parámetros. Fijarla, incluso en cero, no garantiza repetir un resultado entre servicios, versiones o condiciones de ejecución.
- Transformer / atención. La arquitectura dominante en LLMs; la atención pondera qué partes del contexto influyen cada token.
Componentes de sistema
- RAG (Retrieval-Augmented Generation). Recuperar información externa y aportarla al contexto de generación. La búsqueda puede ser vectorial, léxica, estructurada o híbrida. Superficie de la Parte 07.
- Agente. Sistema que usa un modelo para elegir pasos y herramientas en función de un objetivo y de sus observaciones. ReAct es un patrón posible, no la definición de todo agente. Superficie de la Parte 05.
- MCP (Model Context Protocol). Protocolo para que aplicaciones de IA intercambien contexto y capacidades con servidores, incluidos tools, recursos y prompts. Superficie de la Parte 06.
- A2A (Agent-to-Agent). Protocolo de coordinación entre agentes.
- Vector DB. Base que almacena e indexa embeddings (Weaviate, Qdrant, Pinecone, Milvus, Chroma).
- Inference server. Sirve el modelo (vLLM, TGI, Ollama). Model registry. Almacena y versiona modelos (MLflow).
- Aislamiento de tenant (tenant isolation). Garantía de que los datos, embeddings, memoria y sesiones de un cliente u organización no sean accesibles desde otro en un sistema compartido. En RAG y vector stores es el control central de la Parte 07; en agentes, aplica a memoria, contexto y herramientas por tenant.
- Policy enforcement point (PEP). Punto de la arquitectura donde se aplican las decisiones de política: gateway, proxy de tools, orquestador. Complementa al motor de políticas que decide (a veces llamado PDP, policy decision point): sin un PEP en el camino de cada llamada sensible, la política es solo documentación. Superficie de las partes 05, 06 y 10.
Términos de ataque
- Adversarial example. Entrada diseñada o modificada para provocar un error del modelo bajo restricciones definidas, por ejemplo una perturbación acotada (evasión).
- Poisoning. Corromper datos de entrenamiento o de la KB para alterar el comportamiento.
- Membership inference. Inferir si un dato perteneció al conjunto de entrenamiento, con errores y confianza que deben medirse; no es una confirmación automática de pertenencia.
- Guardrail. Conjunto de políticas, clasificadores, reglas y controles de ejecución que limita entradas, salidas o acciones. No reemplaza autorización fuera del modelo.
- Procedencia (provenance). Registro de origen, transformación y autorización de un dato, artefacto o resultado.
- Capacidad vs autorización. Que un agente pueda descubrir una herramienta no implica que esté autorizado a usarla para toda acción o dato.
- Memoria. Estado que el agente reutiliza. Puede ser efímero, por sesión, o persistente; cada tipo requiere límites de escritura, procedencia y retención.
Cómo vamos a reconocer una prueba
Un marcador de prueba es una cadena sintética que permite seguir un caso en una respuesta o una traza. En esta guía usamos este formato:
PHILO_TEST_<PARTE>_<CASO>No es un secreto ni necesita conectarse a ningún servicio. Si lo ponés en un documento de prueba, su aparición puede ayudarte a confirmar que ese documento llegó a una salida. Para demostrar prompt injection, además necesitás observar que se siguió una instrucción ajena: citar el marcador como contenido no alcanza. Y para demostrar acceso indebido, el marcador debe provenir de un recurso que la identidad de prueba no tenía permitido leer.
Reservamos canary token para un señuelo cuya interacción está instrumentada para generar una señal. Que una cadena sea fácil de reconocer no la convierte en ese mecanismo de detección.
Estos términos describen piezas, no prueban su presencia. La anatomía del sistema muestra cómo ubicarlas en capas y el reconocimiento las confirmará o descartará.

