La Agéntica explicada como una aventura de robots curiosos
Una guía para descubrir, desde cero, cómo aprenden los ordenadores a leer, buscar información, usar herramientas y colaborar. Primero lo veremos con historias y ejemplos sencillos; después bajaremos al nivel técnico para entender cómo se construye de verdad.
Modelos de lenguaje grandes
Qué debes comprender
Tokenización
Convierte texto en unidades discretas y después en identificadores enteros. Un token puede ser una palabra, subpalabra, byte, signo o fragmento. Determina coste, longitud efectiva del contexto y tratamiento de idiomas, números y código. Curso de NLP en español.
BPE y SentencePiece
BPE aprende fusiones frecuentes de símbolos; SentencePiece puede entrenarse directamente sobre texto sin depender de espacios y admite BPE o unigram. No son sinónimos de “embedding”.
Transformer
Arquitectura basada en atención, redes feed-forward, residuales, normalización e información posicional. Los LLMs conversacionales suelen ser decoder-only con máscara causal.
Atención Q-K-V
Las consultas, claves y valores calculan qué información debe usar cada posición. La atención multi-cabeza permite aprender relaciones diferentes en paralelo.
Preentrenamiento
Aprendizaje general sobre grandes corpus. En un modelo causal se maximiza la probabilidad del siguiente token; no equivale a crear una base de datos estructurada consultable.
Decoder-only y causalidad
Cada posición sólo puede atender a tokens anteriores. Es la configuración habitual de GPT, Llama, Mistral y muchos modelos generativos de chat.
Ventana de contexto
Número máximo de tokens que el modelo puede procesar en una solicitud, incluyendo instrucciones, historial, documentos recuperados y salida según la API.
Logits y probabilidades
Los logits son puntuaciones sin normalizar para el siguiente token. softmax las convierte en una distribución de probabilidad antes de decodificar.
Inferencia y decodificación
Inferencia autoregresiva
Tokenizar → pasada hacia delante → logits → selección del token → añadirlo al contexto → repetir hasta una condición de parada. Los pesos no se actualizan durante inferencia.
- Greedy: el token más probable.
- Beam search: varias hipótesis; común en traducción.
- Sampling: muestreo controlado por temperatura y filtros.
Temperatura y top-p
La temperatura aplana o concentra la distribución. top-p conserva el conjunto mínimo cuya probabilidad acumulada alcanza p. No añaden conocimiento: sólo cambian la selección.
Eficiencia
KV cache
Reutiliza claves y valores de atención de tokens anteriores durante la generación. Reduce recálculo, pero consume memoria creciente con el contexto.
Cuantización
Representa pesos, activaciones o KV con menos bits, como INT8 o INT4. Reduce memoria y ancho de banda, con posible pérdida de calidad. PTQ cuantiza después; QAT simula el efecto durante entrenamiento.
PagedAttention
Gestiona la KV cache en bloques paginados para aprovechar mejor la memoria en serving de muchas solicitudes. Es una técnica de gestión, no una arquitectura de modelo.
Decodificación especulativa
Un modelo pequeño propone varios tokens y uno mayor los verifica, con el objetivo de acelerar generación sin cambiar —cuando se cumplen las condiciones— la distribución objetivo.
APIs y serving
Una API de LLM es la interfaz programática del modelo: recibe mensajes, modelo y parámetros; devuelve texto, uso de tokens, razón de parada y, a veces, herramientas o salida estructurada. Streaming entrega fragmentos progresivos —a menudo SSE—. Las claves nunca deben exponerse en el navegador.
- Curso de NLP de Hugging Face en español español · curso
- Transformers en español español · docs
- Attention Is All You Need paper original
- vLLM y llama.cpp serving · inglés
🧪 Simulador: la temperatura de decodificación
El modelo guarda logits (puntuaciones) para cada token candidato. La temperatura divide esos logits antes del softmax: T=1 mantiene la distribución aprendida, T baja la concentra (más determinista) y T alta la aplana (más variada). Mueve el deslizador y observa cómo cambian las probabilidades.
Fine-tuning y alineación
Adaptar un modelo
SFT
Supervised Fine-Tuning: ajusta el modelo con ejemplos entrada–salida, normalmente instrucciones y respuestas. Enseña formato, dominio y comportamiento explícito, pero hereda sesgos y cobertura de los datos.
Continual pre-training
Continúa el objetivo de preentrenamiento sobre un corpus de dominio. Puede aportar vocabulario y estilo, pero no sustituye necesariamente el ajuste de instrucciones.
PEFT
Parameter-Efficient Fine-Tuning: congela la mayor parte del modelo y entrena pocos parámetros adicionales. Reduce memoria, almacenamiento y coste de múltiples variantes.
Olvido catastrófico
La adaptación puede degradar capacidades aprendidas previamente. Se mitiga con datos representativos, tasas de aprendizaje controladas, regularización y evaluación antes/después.
LoRA y QLoRA
LoRA
Congela W y aprende una actualización de bajo rango:
El rango r, módulos objetivo, alpha, dropout y tasa de aprendizaje determinan capacidad y estabilidad.
QLoRA
Combina un modelo base cuantizado —frecuentemente 4 bits— con adaptadores LoRA entrenables. NF4, doble cuantización y optimizadores paginados reducen memoria; no hacen que la cuantización sea gratuita ni sin pérdida.
- PEFT — documentación oficial (inglés) · bitsandbytes — documentación oficial (inglés) docs oficiales
- LoRA · QLoRA papers originales
Alineación mediante preferencias
RLHF
Pipeline clásico: SFT → comparaciones humanas → modelo de recompensa → optimización RL, tradicionalmente PPO, con penalización KL frente a un modelo de referencia. Es flexible pero complejo e inestable si la recompensa es imperfecta.
RLAIF
Sustituye o complementa el feedback humano por preferencias generadas mediante IA. Reduce coste de anotación, pero introduce dependencia del evaluador y sus sesgos.
Reward model
Modelo que puntúa respuestas según preferencias observadas. No es una medida objetiva de verdad; puede ser manipulado mediante reward hacking.
DPO
Optimiza directamente pares preferido/rechazado frente a un modelo de referencia, sin entrenar explícitamente reward model ni ejecutar PPO. Es más sencillo, pero sigue dependiendo de la calidad de las preferencias y de β.
IPO, KTO, ORPO
Familia de variantes de optimización por preferencias con diferentes objetivos y supuestos. No deben tratarse como idénticas a DPO; compara pérdidas y requisitos de datos.
Model-as-judge
Un LLM puntúa respuestas con una rúbrica. Es útil para escalar, pero requiere calibración humana, pruebas de sesgo y casos de referencia.
- TRL — documentación oficial (inglés) · DPOTrainer inglés · docs
- InstructGPT / RLHF · Human Preferences · DPO papers originales
Embeddings, recuperación y RAG
Embeddings: cómo el texto se convierte en números
Embedding
Vector denso que representa semánticamente un texto u objeto. Consulta y documentos deben usar un espacio compatible; cercanía no garantiza verdad factual.
Coseno
Compara el ángulo entre vectores: (a·b)/(||a||·||b||). Con vectores normalizados, ordenar por coseno equivale a ordenar por producto punto.
Bi-encoder
Codifica consulta y documento por separado y permite indexar documentos eficientemente.
Cross-encoder
Procesa consulta y documento juntos; es más preciso para reranking, pero demasiado caro para recorrer todo el corpus.
Chunking
Divide documentos en unidades recuperables. Debe respetar títulos, párrafos, tablas, metadatos y permisos; chunks demasiado pequeños pierden contexto y demasiado grandes introducen ruido.
Metadatos
Conserva fuente, página, fecha, permisos, tipo de documento e identificador. Permiten filtros, citas y trazabilidad.
RAG en acción: dos caminos, una respuesta
El patrón RAG ha evolucionado. El RAG básico recuperaba una sola vez y generaba; el RAG moderno (el del diagrama) reescribe la consulta cuando hace falta, combina búsqueda semántica y léxica, reordena con un reranker y evalúa la respuesta; el RAG agéntico añade decisión: el sistema elige qué fuente consultar, re-busca si le falta contexto o divide la pregunta en varias. En todos los casos la recuperación aporta contexto, no garantiza verdad: un fragmento equivocado produce una respuesta equivocada aunque el modelo sea muy potente.
| Patrón | Qué hace | Cuándo encaja |
|---|---|---|
| RAG básico | Una recuperación, una generación. | Prototipos, dominios estables y pocos documentos. |
| RAG moderno | Reescribe la pregunta, busca híbrido, rerank y evalúa. | Producción: mejor precisión a cambio de latencia y coste. |
| RAG agéntico | Decide fuentes, re-busca o divide la pregunta. | Documentos variados, preguntas complejas o varios repositorios. |
- RAG for Knowledge-Intensive NLP Tasks paper original
- Introducción a RAG — Microsoft español
Guardar y buscar: índices y búsqueda híbrida
ANN
Approximate Nearest Neighbor: busca vecinos cercanos de forma aproximada para escalar. Sacrifica algo de exactitud a cambio de latencia y memoria razonables.
HNSW
Grafo de proximidad por capas. M controla conexiones; efConstruction el esfuerzo al construir; efSearch el esfuerzo al consultar. Más recall suele costar más latencia/memoria.
IVF
Divide el espacio en listas o centroides y sólo explora una parte durante la consulta. Ajusta recall y coste mediante el número de listas exploradas.
BM25
Recuperación léxica basada en frecuencia de términos y normalización por longitud. Es especialmente fuerte para nombres, códigos e identificadores.
Búsqueda híbrida
Combina recuperación semántica y léxica; suele cubrir mejor tanto paráfrasis como coincidencias exactas.
RRF
Reciprocal Rank Fusion fusiona rankings sin exigir que sus puntuaciones estén calibradas. Es una opción simple para combinar BM25 y vectorial.
Afinar los resultados y medir la calidad
Reranking
Recupera muchos candidatos baratos y los reordena con un cross-encoder más preciso. No recupera documentos que no estaban en el conjunto inicial.
Métricas
Recall@k mide evidencia encontrada; Precision@k, relevancia de los primeros resultados; MRR/nDCG, posición; faithfulness, respaldo de afirmaciones; answer relevance, adecuación a la pregunta.
- Búsqueda vectorial — Microsoft · MongoDB Vector Search español
- HNSW · Ragas · Ragas docs papers/docs
🧭 Recorrido guiado: una pregunta viaja por RAG
Toca cada etapa y sigue el viaje: las flechas recorren el mismo camino que el diagrama de arriba, con el mismo color de caja. También puedes navegar con ← / →.
Herramientas y comunicación: MCP y A2A
MCP — Model Context Protocol
Host
Aplicación de IA que coordina la experiencia y crea conexiones MCP. Puede ser un IDE, cliente de escritorio, aplicación web o agente.
Client
Componente dentro del host que mantiene una conexión con un servidor MCP y negocia capacidades.
Server
Programa que expone capacidades a clientes MCP mediante un protocolo estructurado.
Tools
Funciones invocables por el modelo o el agente, como consultar una API, buscar en una base o ejecutar una operación controlada.
Resources
Datos o contenido contextual que el servidor ofrece a la aplicación: ficheros, registros, documentos u otros recursos identificables.
Prompts
Plantillas reutilizables expuestas por el servidor. No equivalen a una política de seguridad: siguen necesitando validación y límites.
Transporte y ciclo de vida
La sesión negocia versión y capacidades. Los transportes y detalles admitidos dependen de la especificación vigente; revisa siempre la versión canónica antes de implementar.
Seguridad MCP
Autenticación, autorización por herramienta, validación de esquemas, límites de recursos, sandbox y confirmación humana para acciones de riesgo.
- Documentación oficial MCP inglés · especificación
- Python SDK · especificación repos oficiales
A2A — Agent2Agent
Agent Card
Metadatos publicados por un agente para describir identidad, capacidades, interfaces y cómo iniciar una interacción.
Task
Unidad de trabajo delegada entre agentes, con estado y resultado potencialmente asíncrono.
Artifact
Resultado o producto generado durante la tarea: texto, archivo, estructura de datos u otro recurso.
Delegación
Un agente cliente descubre capacidades de otro y le solicita una tarea sin acoplarse a su implementación interna.
- A2A Protocol inglés · especificación
- Guía A2A de Google Cloud español parcial
MCP frente a A2A
| Pregunta | MCP | A2A |
|---|---|---|
| ¿Conecta qué? | Agente/aplicación con herramientas y contexto. | Un agente con otro agente. |
| ¿Abstracción principal? | Tools, resources, prompts. | Agent Card, tasks, artifacts. |
| ¿Caso típico? | Consultar CRM, filesystem, BD o API. | Delegar investigación, cálculo o tarea especializada. |
| ¿Se excluyen? | No. Un agente A2A puede usar MCP internamente. | |
Sistemas multi-agente
Qué es un agente
En ingeniería de LLMs, un agente suele ser un sistema que combina modelo, instrucciones, estado, herramientas y un bucle de decisión para alcanzar un objetivo. No toda llamada a una API es un agente: un workflow determinista puede tener LLMs sin delegación ni autonomía.
Observation → reasoning → action
Bucle conceptual: observar entrada/resultado, decidir siguiente paso, ejecutar una herramienta o responder. En producción se debe acotar con límites de pasos, tiempo y coste.
Planner / executor
Un componente descompone el objetivo y otros ejecutan tareas. Aumenta control, pero puede introducir planes innecesarios y errores de propagación.
Supervisor
Un agente central enruta trabajo hacia especialistas y decide cuándo finalizar. Facilita observabilidad, pero es un punto de fallo y coste.
Swarm / peer-to-peer
Agentes colaboran con control más distribuido. Puede ser flexible, pero complica terminación, trazabilidad y consistencia.
Critic-revisor
Un agente genera y otro revisa con una rúbrica. La revisión no garantiza verdad: debe usar fuentes, tests o criterios verificables.
Debate
Varios agentes proponen y contrastan soluciones. Puede mejorar cobertura, pero multiplica tokens y no elimina el consenso erróneo.
Memoria
Memoria de trabajo
Contexto de la tarea actual: mensajes, observaciones, plan, resultados intermedios y restricciones.
Memoria persistente
Información que sobrevive a una ejecución: base de datos, documentos, preferencias o episodios. Requiere retención, borrado, permisos y control de calidad.
Memoria semántica
Hechos o documentos indexados por embeddings. Recuperar no implica que el hecho sea cierto ni vigente.
Memoria compartida
Estado accesible a varios agentes. Debe tener esquema, propietario, control de concurrencia, versionado y reglas de escritura.
Negociación y coordinación
La negociación no es “dejar que los modelos conversen” sin restricciones. Define protocolos de mensaje, roles, presupuesto, criterios de aceptación, autoridad y resolución de conflictos.
- Structured outputs: mensajes con esquema validable.
- Consenso: decisión a partir de propuestas; puede ser mayoritario, ponderado o supervisor.
- Task decomposition: dividir una meta en subtareas medibles.
- Idempotencia: repetir una acción no debe duplicar efectos peligrosos.
- Termination: máximo de rondas, estado terminal y timeout.
- AutoGen · MetaGPT · Generative Agents papers originales
- LangGraph docs actuales · inglés
🤝 Simulador: un equipo de agentes en acción
Pulsa «🚀 Lanzar tarea» y sigue cómo el Planificador descompone la meta, el Investigador busca información y el Redactor entrega el resultado. Cada paso lo lanzas tú; al final el equipo alcanza un estado terminal y se detiene.
El equipo espera la tarea…
Software agentivo y frameworks
Framework no es arquitectura
Un framework proporciona primitivas; no decide por ti qué debe ser autónomo, qué herramientas son seguras o cómo evaluar calidad. El diseño debe comenzar por el caso de uso y elegir después el nivel de control.
| Framework | Idea central | Cuándo encaja | Riesgo a vigilar |
|---|---|---|---|
| LangGraph | Grafo explícito, estado y transiciones. | Flujos con control, pausas, reintentos y persistencia. | Complejidad del estado y dependencia del ecosistema. |
| CrewAI | Agentes, tareas y equipos. | Prototipos de roles y colaboración con API sencilla. | Delegación implícita, coste y control de bucles. |
| AutoGen | Conversaciones y componentes multi-agente. | Investigación de patrones conversacionales y agentes especializados. | Cambios de versión y terminación no acotada. |
| smolagents | Primitivas pequeñas para herramientas y agentes. | Aprendizaje, prototipos y control ligero. | Debes construir más piezas de producción. |
Despliegue
API de aplicación
Expone tareas a clientes; valida entrada, autentica, limita recursos y devuelve resultados/citas.
Serving del modelo
Sirve inferencia local o remota. Mide throughput, latencia p95, tamaño de lotes, uso de GPU y coste.
Workers y colas
Separan solicitudes largas de la API síncrona; requieren idempotencia, reintentos y estado persistente.
SSE/WebSocket
Streaming de eventos al cliente. No debe confundirse con la garantía de que el agente haya terminado correctamente.
Observabilidad
Traza cada paso: modelo, prompt versionado, herramienta, argumentos, resultado, tokens, latencia, errores y decisión final.
Human-in-the-loop
Solicita aprobación antes de acciones irreversibles, financieras, externas o con datos sensibles.
Evaluación, seguridad y gobernanza
Evaluación de agentes
Correctness
¿La respuesta o acción satisface el objetivo y los hechos son correctos?
Task success
¿La tarea completa termina en el estado esperado? Usa tests y resultados estructurados cuando sea posible.
Tool accuracy
¿Selecciona la herramienta correcta y proporciona argumentos válidos?
Coste y latencia
Tokens, llamadas, tiempo total, p50/p95/p99, tasa de reintentos y consumo de herramientas.
Robustez
Comportamiento ante instrucciones ambiguas, fallos de API, documentos contradictorios y entradas adversariales.
Regresión
Conjunto fijo de casos que se ejecuta tras cambiar modelo, prompt, herramienta, índice o framework.
Riesgos específicos
Prompt injection
Contenido no confiable intenta alterar instrucciones o extraer secretos. Trátalo como datos, separa instrucciones de contexto y limita herramientas.
Indirect prompt injection
La instrucción maliciosa llega desde una web, PDF, correo o documento recuperado, no desde el usuario visible.
Tool poisoning
Descripción, respuesta o servidor de una herramienta intenta influir en el agente. Verifica origen, permisos y cambios de esquema.
Exfiltración
El agente usa una herramienta legítima para enviar datos a un destino no autorizado. Aplica allowlists, DLP, red restringida y aprobación humana.
Exceso de autonomía
Un agente ejecuta acciones con más permisos, presupuesto o duración de la necesaria. Practica mínimo privilegio y límites.
Datos y privacidad
Clasifica datos, define retención, borrado, auditoría, residencia y acceso. No envíes secretos a prompts o proveedores sin base legal y técnica.
- OWASP Top 10 LLM inglés · seguridad
- Microsoft Responsible AI · NIST AI RMF gobernanza
Checklist mínimo antes de producción
- Herramientas con esquema, allowlist y permisos mínimos.
- Timeout, máximo de pasos, límite de tokens y presupuesto por tarea.
- Validación de entrada y salida; no ejecutar código arbitrario por defecto.
- Secretos sólo en backend o gestor de secretos.
- Logs sin exponer datos sensibles y con trazabilidad de versión.
- Pruebas de inyección directa e indirecta.
- Confirmación humana para acciones irreversibles.
- Dataset de evaluación y regresión automatizada.
- Plan de apagado, rollback y respuesta a incidentes.
¿Cuánto has aprendido? Autoevaluación
1. ¿Qué controla principalmente la temperatura de un LLM al generar?
2. ¿Qué diferencia clave hay entre RLHF y DPO?
3. En un sistema RAG, ¿para qué sirve el índice vectorial?
4. ¿Qué es MCP en su uso principal?
5. ¿Por qué se define un estado terminal en un equipo de agentes?
6. Ante contenido externo que pueda intentar inyectar instrucciones (prompt injection), ¿qué defensa es la más sólida?
Glosario rápido
| Término | No significa | Significa |
|---|---|---|
| LLM | Base de datos factual. | Modelo que estima distribuciones de tokens y genera secuencias. |
| Embedding | Respuesta generada. | Vector usado para representar y comparar entidades. |
| RAG | Fine-tuning automático. | Recuperación de contexto más generación. |
| Agente | Cualquier chatbot. | Sistema con decisión/estado/herramientas orientado a objetivo. |
| MCP | Protocolo de comunicación entre agentes. | Protocolo de conexión de aplicaciones de IA con herramientas/contexto. |
| A2A | Un SDK concreto. | Protocolo para interacción y delegación entre agentes. |
| Fine-tuning | Actualizar documentos consultables. | Ajustar parámetros o adaptadores del modelo. |
| Evaluación | Una única puntuación de LLM. | Medición de calidad, seguridad, coste, latencia y fiabilidad según el caso. |
Fuentes verificadas y lecturas base
- Hugging Face — Curso de NLP en español · tokenización, Transformers, fine-tuning.
- Hugging Face — LLM Course en español · modelos y práctica.
- Hugging Face PEFT · adaptadores y LoRA.
- Hugging Face TRL · SFT, DPO y RLHF.
- Microsoft — RAG · búsqueda vectorial.
- MCP — especificación canónica · inglés.
- A2A — especificación canónica · inglés.
- LangGraph · CrewAI · AutoGen.
- Transformer · LoRA · QLoRA · DPO.
- RAG · HNSW · Ragas.
- OWASP Top 10 para aplicaciones LLM · seguridad.
- NIST AI RMF · gestión de riesgos.