Laboratorio interactivo · Curso de IA

RAG: el examen a libro abierto de la IA

Generación Aumentada por Recuperación (Retrieval-Augmented Generation). Explora cada componente del pipeline manipulándolo tú mismo: del documento al chunk, del chunk al vector, y del vector a la respuesta fundamentada.

Prerrequisitos: tokens · embeddings · ventana de contexto  |  Duración sugerida: 30–40 min
Módulo 01 · El problema

¿Por qué un LLM solo no es suficiente?

Un LLM tiene dos brechas: su conocimiento queda congelado en la fecha de su entrenamiento, y no conoce los datos privados de tu organización. Cuando le preguntas algo fuera de esos límites, tiende a alucinar: inventa respuestas plausibles pero falsas. Pruébalo:

Elige un modo arriba y observa cómo cambia la respuesta a la misma pregunta.
Módulo 02 · La analogía

Dos formas de rendir un examen

Antes de ver la arquitectura, fija esta imagen mental. Es la clave para entender todo lo que sigue.

🧠

Examen a memoria cerrada

LLM sin RAG. El estudiante responde solo con lo que memorizó hace meses. Si no recuerda algo, lo inventa con seguridad. No puede citar de dónde sacó cada dato.

📖

Examen a libro abierto

LLM con RAG. El estudiante consulta fuentes autorizadas antes de responder. No intenta recordar: busca, lee y fundamenta. Puede señalar la página exacta de donde salió cada afirmación.

RAG transforma la generación en exactamente eso: el modelo no recuerda de su memoria interna, sino que consulta fuentes proporcionadas por la organización en tiempo real para fundamentar cada afirmación. Esto añade precisión, transparencia y verificabilidad.

Módulo 03 · Arquitectura

El pipeline RAG, paso a paso

Sigue el recorrido de una pregunta real: «¿Cuál es la política de vacaciones para empleados remotos?». Avanza con el botón y observa qué ocurre en cada componente.

📄
Indexación
Pregunta
🔢
Embedding
🔍
Búsqueda
Prompt aumentado
💬
Respuesta

Pulsa «Iniciar» para comenzar

Verás las dos fases del sistema: la fase de indexación (offline, se hace una sola vez por documento) y la fase de consulta (online, ocurre con cada pregunta).

Módulo 04 · Indexación

Chunking: el arte de fragmentar documentos

Antes de vectorizar, los documentos se dividen en chunks (fragmentos). El tamaño importa: chunks muy pequeños pierden contexto; chunks muy grandes diluyen la señal de relevancia. Mueve el control y observa el trade-off sobre este manual de empleados:

Mediano (~512 tokens)
4chunks generados
Altapreservación de contexto
Altaprecisión de relevancia

Módulo 05 · Recuperación

Búsqueda por significado, no por palabras

Cada chunk vive como un punto en un espacio vectorial: los temas similares quedan geométricamente cerca, aunque no compartan las mismas palabras. La pregunta también se convierte en un punto, y el sistema recupera sus vecinos más cercanos (top-k). Lanza una consulta:

Vacaciones y permisos Gastos y reembolsos Seguridad informática ★ Tu consulta

Módulo 06 · Conexión con lo aprendido

RAG une todo lo que ya sabes

RAG no es un concepto nuevo aislado: es el ensamblaje de las tres piezas que vimos en sesiones anteriores.

Sesión: Tokens

→ Chunking

Los chunks se miden en tokens (típicamente 400–512 con 10–20% de solapamiento). Sin entender tokens, no puedes dimensionar chunks.

Sesión: Embeddings

→ Recuperación

Los embeddings son el mecanismo que hace posible la búsqueda: convierten pregunta y documentos a vectores comparables matemáticamente.

Sesión: Ventana de contexto

→ Prompt aumentado

Los chunks recuperados se inyectan dentro de la ventana de contexto del LLM. Por eso no enviamos el documento entero: no cabría y diluiría la atención.

Módulo 07 · Decisiones de diseño

LLM puro vs. Fine-tuning vs. RAG

Tres opciones para que un modelo responda sobre tus datos. Compara y luego resuelve los escenarios.

CriterioLLM puroFine-tuningRAG
Conoce tus datos privadosNoSí (los memoriza)Sí (los consulta)
ActualizaciónImposibleRe-entrenar cada vez (lento y costoso)Inmediata: basta actualizar la base documental
Costo inicialBajoAlto (miles de dólares, semanas)Moderado
Citar fuentesNoNoSí, con verificabilidad
Riesgo de alucinaciónAltoMedioBajo (respuesta anclada en documentos)

Escenario A

Un banco necesita un asistente que responda sobre regulaciones que cambian cada mes y siempre cite la norma exacta.

Toca para revelar
RAG. La actualización mensual y la exigencia de citar fuentes descartan el fine-tuning. RAG permite verificabilidad, clave en sectores regulados.

Escenario B

Una marca quiere que el modelo escriba siempre con un tono y estilo muy particular, sin datos nuevos.

Toca para revelar
Fine-tuning. Aquí no se trata de recuperar conocimiento, sino de modificar el comportamiento y estilo del modelo. Es el caso de uso natural del ajuste fino.

Escenario C

Un estudiante pide ayuda para entender qué es la fotosíntesis, conocimiento general y estable.

Toca para revelar
LLM puro. El conocimiento general ya está en el entrenamiento del modelo. Añadir RAG aquí sería complejidad y costo innecesarios.
Módulo 08 · Autoevaluación

Comprueba lo que aprendiste

Seis preguntas. Recibirás retroalimentación inmediata en cada una.

Recurso didáctico del curso Introducción práctica a la IA · Construido sobre la base documental del curso: Investigación sobre RAG, IA: Arquitectura, Conceptos y Aplicaciones Modernas y Embeddings: del concepto matemático a las aplicaciones modernas.