¿Por qué un LLM solo no es suficiente?
Un LLM tiene dos brechas: su conocimiento queda congelado en la fecha de su entrenamiento, y no conoce los datos privados de tu organización. Cuando le preguntas algo fuera de esos límites, tiende a alucinar: inventa respuestas plausibles pero falsas. Pruébalo:
Dos formas de rendir un examen
Antes de ver la arquitectura, fija esta imagen mental. Es la clave para entender todo lo que sigue.
Examen a memoria cerrada
LLM sin RAG. El estudiante responde solo con lo que memorizó hace meses. Si no recuerda algo, lo inventa con seguridad. No puede citar de dónde sacó cada dato.
Examen a libro abierto
LLM con RAG. El estudiante consulta fuentes autorizadas antes de responder. No intenta recordar: busca, lee y fundamenta. Puede señalar la página exacta de donde salió cada afirmación.
RAG transforma la generación en exactamente eso: el modelo no recuerda de su memoria interna, sino que consulta fuentes proporcionadas por la organización en tiempo real para fundamentar cada afirmación. Esto añade precisión, transparencia y verificabilidad.
El pipeline RAG, paso a paso
Sigue el recorrido de una pregunta real: «¿Cuál es la política de vacaciones para empleados remotos?». Avanza con el botón y observa qué ocurre en cada componente.
Pulsa «Iniciar» para comenzar
Verás las dos fases del sistema: la fase de indexación (offline, se hace una sola vez por documento) y la fase de consulta (online, ocurre con cada pregunta).
Chunking: el arte de fragmentar documentos
Antes de vectorizar, los documentos se dividen en chunks (fragmentos). El tamaño importa: chunks muy pequeños pierden contexto; chunks muy grandes diluyen la señal de relevancia. Mueve el control y observa el trade-off sobre este manual de empleados:
Búsqueda por significado, no por palabras
Cada chunk vive como un punto en un espacio vectorial: los temas similares quedan geométricamente cerca, aunque no compartan las mismas palabras. La pregunta también se convierte en un punto, y el sistema recupera sus vecinos más cercanos (top-k). Lanza una consulta:
RAG une todo lo que ya sabes
RAG no es un concepto nuevo aislado: es el ensamblaje de las tres piezas que vimos en sesiones anteriores.
→ Chunking
Los chunks se miden en tokens (típicamente 400–512 con 10–20% de solapamiento). Sin entender tokens, no puedes dimensionar chunks.
→ Recuperación
Los embeddings son el mecanismo que hace posible la búsqueda: convierten pregunta y documentos a vectores comparables matemáticamente.
→ Prompt aumentado
Los chunks recuperados se inyectan dentro de la ventana de contexto del LLM. Por eso no enviamos el documento entero: no cabría y diluiría la atención.
LLM puro vs. Fine-tuning vs. RAG
Tres opciones para que un modelo responda sobre tus datos. Compara y luego resuelve los escenarios.
| Criterio | LLM puro | Fine-tuning | RAG |
|---|---|---|---|
| Conoce tus datos privados | No | Sí (los memoriza) | Sí (los consulta) |
| Actualización | Imposible | Re-entrenar cada vez (lento y costoso) | Inmediata: basta actualizar la base documental |
| Costo inicial | Bajo | Alto (miles de dólares, semanas) | Moderado |
| Citar fuentes | No | No | Sí, con verificabilidad |
| Riesgo de alucinación | Alto | Medio | Bajo (respuesta anclada en documentos) |
Escenario A
Un banco necesita un asistente que responda sobre regulaciones que cambian cada mes y siempre cite la norma exacta.
Toca para revelarEscenario B
Una marca quiere que el modelo escriba siempre con un tono y estilo muy particular, sin datos nuevos.
Toca para revelarEscenario C
Un estudiante pide ayuda para entender qué es la fotosíntesis, conocimiento general y estable.
Toca para revelarComprueba lo que aprendiste
Seis preguntas. Recibirás retroalimentación inmediata en cada una.