GUÍA COMPLEMENTARIA · PARA NIÑOS Y NO TAN NIÑOS

La Agéntica explicada como una aventura de robots curiosos

Una guía para descubrir, desde cero, cómo aprenden los ordenadores a leer, buscar información, usar herramientas y colaborar. Primero lo veremos con historias y ejemplos sencillos; después bajaremos al nivel técnico para entender cómo se construye de verdad.

Cómo leer esta guía. Cada tarjeta conserva el esquema original del sidebar: LLMs, adaptación, RAG, protocolos, equipos de agentes, software, seguridad y evaluación. Al abrirla encontrarás una explicación cercana, una analogía, un ejemplo y, después, la versión técnica. No hace falta saber nada de Agéntica para empezar.
Política de verificación. Las definiciones se han contrastado con papers fundacionales, especificaciones primarias y documentación oficial. Los papers suelen estar en inglés; cuando no existe traducción oficial, se conserva la fuente original y se indica el idioma. Una URL oficial no convierte automáticamente una afirmación en verdadera: cada concepto se formula de acuerdo con la fuente técnica correspondiente.
1

Modelos de lenguaje grandes

Ruta original: semanas 1–2 · arquitectura, inferencia y APIs

Qué debes comprender

Tokenización

Convierte texto en unidades discretas y después en identificadores enteros. Un token puede ser una palabra, subpalabra, byte, signo o fragmento. Determina coste, longitud efectiva del contexto y tratamiento de idiomas, números y código. Curso de NLP en español.

BPE y SentencePiece

BPE aprende fusiones frecuentes de símbolos; SentencePiece puede entrenarse directamente sobre texto sin depender de espacios y admite BPE o unigram. No son sinónimos de “embedding”.

Transformer

Arquitectura basada en atención, redes feed-forward, residuales, normalización e información posicional. Los LLMs conversacionales suelen ser decoder-only con máscara causal.

Atención Q-K-V

Las consultas, claves y valores calculan qué información debe usar cada posición. La atención multi-cabeza permite aprender relaciones diferentes en paralelo.

Preentrenamiento

Aprendizaje general sobre grandes corpus. En un modelo causal se maximiza la probabilidad del siguiente token; no equivale a crear una base de datos estructurada consultable.

Decoder-only y causalidad

Cada posición sólo puede atender a tokens anteriores. Es la configuración habitual de GPT, Llama, Mistral y muchos modelos generativos de chat.

Ventana de contexto

Número máximo de tokens que el modelo puede procesar en una solicitud, incluyendo instrucciones, historial, documentos recuperados y salida según la API.

Logits y probabilidades

Los logits son puntuaciones sin normalizar para el siguiente token. softmax las convierte en una distribución de probabilidad antes de decodificar.

Inferencia y decodificación

Inferencia autoregresiva

Tokenizar → pasada hacia delante → logits → selección del token → añadirlo al contexto → repetir hasta una condición de parada. Los pesos no se actualizan durante inferencia.

  • Greedy: el token más probable.
  • Beam search: varias hipótesis; común en traducción.
  • Sampling: muestreo controlado por temperatura y filtros.

Temperatura y top-p

La temperatura aplana o concentra la distribución. top-p conserva el conjunto mínimo cuya probabilidad acumulada alcanza p. No añaden conocimiento: sólo cambian la selección.

Pᵢ = exp(zᵢ/T) / Σⱼ exp(zⱼ/T)

Eficiencia

KV cache

Reutiliza claves y valores de atención de tokens anteriores durante la generación. Reduce recálculo, pero consume memoria creciente con el contexto.

Cuantización

Representa pesos, activaciones o KV con menos bits, como INT8 o INT4. Reduce memoria y ancho de banda, con posible pérdida de calidad. PTQ cuantiza después; QAT simula el efecto durante entrenamiento.

PagedAttention

Gestiona la KV cache en bloques paginados para aprovechar mejor la memoria en serving de muchas solicitudes. Es una técnica de gestión, no una arquitectura de modelo.

Decodificación especulativa

Un modelo pequeño propone varios tokens y uno mayor los verifica, con el objetivo de acelerar generación sin cambiar —cuando se cumplen las condiciones— la distribución objetivo.

APIs y serving

Una API de LLM es la interfaz programática del modelo: recibe mensajes, modelo y parámetros; devuelve texto, uso de tokens, razón de parada y, a veces, herramientas o salida estructurada. Streaming entrega fragmentos progresivos —a menudo SSE—. Las claves nunca deben exponerse en el navegador.

Hito: explica con tus palabras por qué ampliar el contexto aumenta la presión sobre la KV cache y por qué temperatura no equivale a “creatividad” aprendida.

🧪 Simulador: la temperatura de decodificación

El modelo guarda logits (puntuaciones) para cada token candidato. La temperatura divide esos logits antes del softmax: T=1 mantiene la distribución aprendida, T baja la concentra (más determinista) y T alta la aplana (más variada). Mueve el deslizador y observa cómo cambian las probabilidades.

🧊 Determinista⚖️ Natural🎨 Creativa

2

Fine-tuning y alineación

Ruta original: semanas 3–4 · SFT, PEFT, LoRA, RLHF y DPO

Adaptar un modelo

SFT

Supervised Fine-Tuning: ajusta el modelo con ejemplos entrada–salida, normalmente instrucciones y respuestas. Enseña formato, dominio y comportamiento explícito, pero hereda sesgos y cobertura de los datos.

Continual pre-training

Continúa el objetivo de preentrenamiento sobre un corpus de dominio. Puede aportar vocabulario y estilo, pero no sustituye necesariamente el ajuste de instrucciones.

PEFT

Parameter-Efficient Fine-Tuning: congela la mayor parte del modelo y entrena pocos parámetros adicionales. Reduce memoria, almacenamiento y coste de múltiples variantes.

Olvido catastrófico

La adaptación puede degradar capacidades aprendidas previamente. Se mitiga con datos representativos, tasas de aprendizaje controladas, regularización y evaluación antes/después.

LoRA y QLoRA

LoRA

Congela W y aprende una actualización de bajo rango:

W′ = W + ΔW ··· ΔW = B·A

El rango r, módulos objetivo, alpha, dropout y tasa de aprendizaje determinan capacidad y estabilidad.

QLoRA

Combina un modelo base cuantizado —frecuentemente 4 bits— con adaptadores LoRA entrenables. NF4, doble cuantización y optimizadores paginados reducen memoria; no hacen que la cuantización sea gratuita ni sin pérdida.

Alineación mediante preferencias

RLHF

Pipeline clásico: SFT → comparaciones humanas → modelo de recompensa → optimización RL, tradicionalmente PPO, con penalización KL frente a un modelo de referencia. Es flexible pero complejo e inestable si la recompensa es imperfecta.

RLAIF

Sustituye o complementa el feedback humano por preferencias generadas mediante IA. Reduce coste de anotación, pero introduce dependencia del evaluador y sus sesgos.

Reward model

Modelo que puntúa respuestas según preferencias observadas. No es una medida objetiva de verdad; puede ser manipulado mediante reward hacking.

DPO

Optimiza directamente pares preferido/rechazado frente a un modelo de referencia, sin entrenar explícitamente reward model ni ejecutar PPO. Es más sencillo, pero sigue dependiendo de la calidad de las preferencias y de β.

IPO, KTO, ORPO

Familia de variantes de optimización por preferencias con diferentes objetivos y supuestos. No deben tratarse como idénticas a DPO; compara pérdidas y requisitos de datos.

Model-as-judge

Un LLM puntúa respuestas con una rúbrica. Es útil para escalar, pero requiere calibración humana, pruebas de sesgo y casos de referencia.

Error habitual: fine-tuning no es una base de datos. Para conocimiento que cambia con frecuencia, suele ser mejor RAG; el ajuste puede reservarse para formato, estilo, clasificación o comportamiento.
3

Embeddings, recuperación y RAG

Ruta original: semanas 5–6 · embeddings, índices, búsqueda híbrida y evaluación

Embeddings: cómo el texto se convierte en números

Embedding

Vector denso que representa semánticamente un texto u objeto. Consulta y documentos deben usar un espacio compatible; cercanía no garantiza verdad factual.

Coseno

Compara el ángulo entre vectores: (a·b)/(||a||·||b||). Con vectores normalizados, ordenar por coseno equivale a ordenar por producto punto.

Bi-encoder

Codifica consulta y documento por separado y permite indexar documentos eficientemente.

Cross-encoder

Procesa consulta y documento juntos; es más preciso para reranking, pero demasiado caro para recorrer todo el corpus.

Chunking

Divide documentos en unidades recuperables. Debe respetar títulos, párrafos, tablas, metadatos y permisos; chunks demasiado pequeños pierden contexto y demasiado grandes introducen ruido.

Metadatos

Conserva fuente, página, fecha, permisos, tipo de documento e identificador. Permiten filtros, citas y trazabilidad.

RAG en acción: dos caminos, una respuesta

PREPARACIÓN · OFFLINEDocumentosPDF · web · FAQsTroceadochunks · metadatosEmbeddingsun vector por chunkÍndice vectorialHNSW · IVF · híbridoCONSULTA · ONLINEPreguntadel usuarioBúsquedasemántica + BM25Rerankingcross-encoderLLM con contextoinstrucción + chunksRespuestacon citas · evaluada

El patrón RAG ha evolucionado. El RAG básico recuperaba una sola vez y generaba; el RAG moderno (el del diagrama) reescribe la consulta cuando hace falta, combina búsqueda semántica y léxica, reordena con un reranker y evalúa la respuesta; el RAG agéntico añade decisión: el sistema elige qué fuente consultar, re-busca si le falta contexto o divide la pregunta en varias. En todos los casos la recuperación aporta contexto, no garantiza verdad: un fragmento equivocado produce una respuesta equivocada aunque el modelo sea muy potente.

PatrónQué haceCuándo encaja
RAG básicoUna recuperación, una generación.Prototipos, dominios estables y pocos documentos.
RAG modernoReescribe la pregunta, busca híbrido, rerank y evalúa.Producción: mejor precisión a cambio de latencia y coste.
RAG agénticoDecide fuentes, re-busca o divide la pregunta.Documentos variados, preguntas complejas o varios repositorios.

Guardar y buscar: índices y búsqueda híbrida

ANN

Approximate Nearest Neighbor: busca vecinos cercanos de forma aproximada para escalar. Sacrifica algo de exactitud a cambio de latencia y memoria razonables.

HNSW

Grafo de proximidad por capas. M controla conexiones; efConstruction el esfuerzo al construir; efSearch el esfuerzo al consultar. Más recall suele costar más latencia/memoria.

IVF

Divide el espacio en listas o centroides y sólo explora una parte durante la consulta. Ajusta recall y coste mediante el número de listas exploradas.

BM25

Recuperación léxica basada en frecuencia de términos y normalización por longitud. Es especialmente fuerte para nombres, códigos e identificadores.

Búsqueda híbrida

Combina recuperación semántica y léxica; suele cubrir mejor tanto paráfrasis como coincidencias exactas.

RRF

Reciprocal Rank Fusion fusiona rankings sin exigir que sus puntuaciones estén calibradas. Es una opción simple para combinar BM25 y vectorial.

Afinar los resultados y medir la calidad

Reranking

Recupera muchos candidatos baratos y los reordena con un cross-encoder más preciso. No recupera documentos que no estaban en el conjunto inicial.

Métricas

Recall@k mide evidencia encontrada; Precision@k, relevancia de los primeros resultados; MRR/nDCG, posición; faithfulness, respaldo de afirmaciones; answer relevance, adecuación a la pregunta.

🧭 Recorrido guiado: una pregunta viaja por RAG

Toca cada etapa y sigue el viaje: las flechas recorren el mismo camino que el diagrama de arriba, con el mismo color de caja. También puedes navegar con ← / →.

1 / 6
4

Herramientas y comunicación: MCP y A2A

Ruta original: semanas 7–8 · protocolos abiertos
No son el mismo protocolo. MCP significa principalmente Model Context Protocol: conecta una aplicación de IA con herramientas y fuentes de contexto. A2A significa Agent2Agent: estandariza interacción y delegación entre agentes. El término “Multi-Agent Communication Protocol” no es el nombre oficial del MCP dominante en este ecosistema.

MCP — Model Context Protocol

Host

Aplicación de IA que coordina la experiencia y crea conexiones MCP. Puede ser un IDE, cliente de escritorio, aplicación web o agente.

Client

Componente dentro del host que mantiene una conexión con un servidor MCP y negocia capacidades.

Server

Programa que expone capacidades a clientes MCP mediante un protocolo estructurado.

Tools

Funciones invocables por el modelo o el agente, como consultar una API, buscar en una base o ejecutar una operación controlada.

Resources

Datos o contenido contextual que el servidor ofrece a la aplicación: ficheros, registros, documentos u otros recursos identificables.

Prompts

Plantillas reutilizables expuestas por el servidor. No equivalen a una política de seguridad: siguen necesitando validación y límites.

Transporte y ciclo de vida

La sesión negocia versión y capacidades. Los transportes y detalles admitidos dependen de la especificación vigente; revisa siempre la versión canónica antes de implementar.

Seguridad MCP

Autenticación, autorización por herramienta, validación de esquemas, límites de recursos, sandbox y confirmación humana para acciones de riesgo.

A2A — Agent2Agent

Agent Card

Metadatos publicados por un agente para describir identidad, capacidades, interfaces y cómo iniciar una interacción.

Task

Unidad de trabajo delegada entre agentes, con estado y resultado potencialmente asíncrono.

Artifact

Resultado o producto generado durante la tarea: texto, archivo, estructura de datos u otro recurso.

Delegación

Un agente cliente descubre capacidades de otro y le solicita una tarea sin acoplarse a su implementación interna.

MCP frente a A2A

PreguntaMCPA2A
¿Conecta qué?Agente/aplicación con herramientas y contexto.Un agente con otro agente.
¿Abstracción principal?Tools, resources, prompts.Agent Card, tasks, artifacts.
¿Caso típico?Consultar CRM, filesystem, BD o API.Delegar investigación, cálculo o tarea especializada.
¿Se excluyen?No. Un agente A2A puede usar MCP internamente.
5

Sistemas multi-agente

Ruta original: semanas 9–10 · orquestación, negociación y memoria

Qué es un agente

En ingeniería de LLMs, un agente suele ser un sistema que combina modelo, instrucciones, estado, herramientas y un bucle de decisión para alcanzar un objetivo. No toda llamada a una API es un agente: un workflow determinista puede tener LLMs sin delegación ni autonomía.

Observation → reasoning → action

Bucle conceptual: observar entrada/resultado, decidir siguiente paso, ejecutar una herramienta o responder. En producción se debe acotar con límites de pasos, tiempo y coste.

Planner / executor

Un componente descompone el objetivo y otros ejecutan tareas. Aumenta control, pero puede introducir planes innecesarios y errores de propagación.

Supervisor

Un agente central enruta trabajo hacia especialistas y decide cuándo finalizar. Facilita observabilidad, pero es un punto de fallo y coste.

Swarm / peer-to-peer

Agentes colaboran con control más distribuido. Puede ser flexible, pero complica terminación, trazabilidad y consistencia.

Critic-revisor

Un agente genera y otro revisa con una rúbrica. La revisión no garantiza verdad: debe usar fuentes, tests o criterios verificables.

Debate

Varios agentes proponen y contrastan soluciones. Puede mejorar cobertura, pero multiplica tokens y no elimina el consenso erróneo.

Memoria

Memoria de trabajo

Contexto de la tarea actual: mensajes, observaciones, plan, resultados intermedios y restricciones.

Memoria persistente

Información que sobrevive a una ejecución: base de datos, documentos, preferencias o episodios. Requiere retención, borrado, permisos y control de calidad.

Memoria semántica

Hechos o documentos indexados por embeddings. Recuperar no implica que el hecho sea cierto ni vigente.

Memoria compartida

Estado accesible a varios agentes. Debe tener esquema, propietario, control de concurrencia, versionado y reglas de escritura.

Negociación y coordinación

La negociación no es “dejar que los modelos conversen” sin restricciones. Define protocolos de mensaje, roles, presupuesto, criterios de aceptación, autoridad y resolución de conflictos.

  • Structured outputs: mensajes con esquema validable.
  • Consenso: decisión a partir de propuestas; puede ser mayoritario, ponderado o supervisor.
  • Task decomposition: dividir una meta en subtareas medibles.
  • Idempotencia: repetir una acción no debe duplicar efectos peligrosos.
  • Termination: máximo de rondas, estado terminal y timeout.

🤝 Simulador: un equipo de agentes en acción

Pulsa «🚀 Lanzar tarea» y sigue cómo el Planificador descompone la meta, el Investigador busca información y el Redactor entrega el resultado. Cada paso lo lanzas tú; al final el equipo alcanza un estado terminal y se detiene.

🧠Planificadordivide la meta
🔎Investigadorbusca y resume
✍️Redactorescribe la entrega

El equipo espera la tarea…

6

Software agentivo y frameworks

Ruta original: semanas 11–12 · implementación, despliegue y observabilidad

Framework no es arquitectura

Un framework proporciona primitivas; no decide por ti qué debe ser autónomo, qué herramientas son seguras o cómo evaluar calidad. El diseño debe comenzar por el caso de uso y elegir después el nivel de control.

FrameworkIdea centralCuándo encajaRiesgo a vigilar
LangGraphGrafo explícito, estado y transiciones.Flujos con control, pausas, reintentos y persistencia.Complejidad del estado y dependencia del ecosistema.
CrewAIAgentes, tareas y equipos.Prototipos de roles y colaboración con API sencilla.Delegación implícita, coste y control de bucles.
AutoGenConversaciones y componentes multi-agente.Investigación de patrones conversacionales y agentes especializados.Cambios de versión y terminación no acotada.
smolagentsPrimitivas pequeñas para herramientas y agentes.Aprendizaje, prototipos y control ligero.Debes construir más piezas de producción.

Despliegue

API de aplicación

Expone tareas a clientes; valida entrada, autentica, limita recursos y devuelve resultados/citas.

Serving del modelo

Sirve inferencia local o remota. Mide throughput, latencia p95, tamaño de lotes, uso de GPU y coste.

Workers y colas

Separan solicitudes largas de la API síncrona; requieren idempotencia, reintentos y estado persistente.

SSE/WebSocket

Streaming de eventos al cliente. No debe confundirse con la garantía de que el agente haya terminado correctamente.

Observabilidad

Traza cada paso: modelo, prompt versionado, herramienta, argumentos, resultado, tokens, latencia, errores y decisión final.

Human-in-the-loop

Solicita aprobación antes de acciones irreversibles, financieras, externas o con datos sensibles.

7

Evaluación, seguridad y gobernanza

Aplicable a todos los módulos

Evaluación de agentes

Correctness

¿La respuesta o acción satisface el objetivo y los hechos son correctos?

Task success

¿La tarea completa termina en el estado esperado? Usa tests y resultados estructurados cuando sea posible.

Tool accuracy

¿Selecciona la herramienta correcta y proporciona argumentos válidos?

Coste y latencia

Tokens, llamadas, tiempo total, p50/p95/p99, tasa de reintentos y consumo de herramientas.

Robustez

Comportamiento ante instrucciones ambiguas, fallos de API, documentos contradictorios y entradas adversariales.

Regresión

Conjunto fijo de casos que se ejecuta tras cambiar modelo, prompt, herramienta, índice o framework.

Riesgos específicos

Prompt injection

Contenido no confiable intenta alterar instrucciones o extraer secretos. Trátalo como datos, separa instrucciones de contexto y limita herramientas.

Indirect prompt injection

La instrucción maliciosa llega desde una web, PDF, correo o documento recuperado, no desde el usuario visible.

Tool poisoning

Descripción, respuesta o servidor de una herramienta intenta influir en el agente. Verifica origen, permisos y cambios de esquema.

Exfiltración

El agente usa una herramienta legítima para enviar datos a un destino no autorizado. Aplica allowlists, DLP, red restringida y aprobación humana.

Exceso de autonomía

Un agente ejecuta acciones con más permisos, presupuesto o duración de la necesaria. Practica mínimo privilegio y límites.

Datos y privacidad

Clasifica datos, define retención, borrado, auditoría, residencia y acceso. No envíes secretos a prompts o proveedores sin base legal y técnica.

Checklist mínimo antes de producción

  • Herramientas con esquema, allowlist y permisos mínimos.
  • Timeout, máximo de pasos, límite de tokens y presupuesto por tarea.
  • Validación de entrada y salida; no ejecutar código arbitrario por defecto.
  • Secretos sólo en backend o gestor de secretos.
  • Logs sin exponer datos sensibles y con trazabilidad de versión.
  • Pruebas de inyección directa e indirecta.
  • Confirmación humana para acciones irreversibles.
  • Dataset de evaluación y regresión automatizada.
  • Plan de apagado, rollback y respuesta a incidentes.

¿Cuánto has aprendido? Autoevaluación

6 preguntas · retroalimentación inmediata

1. ¿Qué controla principalmente la temperatura de un LLM al generar?

2. ¿Qué diferencia clave hay entre RLHF y DPO?

3. En un sistema RAG, ¿para qué sirve el índice vectorial?

4. ¿Qué es MCP en su uso principal?

5. ¿Por qué se define un estado terminal en un equipo de agentes?

6. Ante contenido externo que pueda intentar inyectar instrucciones (prompt injection), ¿qué defensa es la más sólida?

A

Glosario rápido

Distinciones que suelen confundirse
TérminoNo significaSignifica
LLMBase de datos factual.Modelo que estima distribuciones de tokens y genera secuencias.
EmbeddingRespuesta generada.Vector usado para representar y comparar entidades.
RAGFine-tuning automático.Recuperación de contexto más generación.
AgenteCualquier chatbot.Sistema con decisión/estado/herramientas orientado a objetivo.
MCPProtocolo de comunicación entre agentes.Protocolo de conexión de aplicaciones de IA con herramientas/contexto.
A2AUn SDK concreto.Protocolo para interacción y delegación entre agentes.
Fine-tuningActualizar documentos consultables.Ajustar parámetros o adaptadores del modelo.
EvaluaciónUna única puntuación de LLM.Medición de calidad, seguridad, coste, latencia y fiabilidad según el caso.

Fuentes verificadas y lecturas base

Primarias, oficiales o institucionales
Cómo leer los enlaces. “Español” significa que la página ofrece localización oficial comprobable; “inglés” significa que se conserva la fuente primaria porque no se ha identificado una traducción oficial completa. Las duraciones y ejemplos de la ruta son orientativos, no afirmaciones de los proveedores.