RAG (Retrieval-Augmented Generation) es una técnica que combina un modelo de lenguaje (como Claude u Ollama) con una base de datos de documentos propios, para que el modelo pueda responder usando información real y actualizada en vez de depender solo de lo que "sabe" de su entrenamiento.

Funciona así:

    Tus documentos (PDFs, manuales, fichas de producto...) se trocean en fragmentos y se convierten en embeddings (vectores numéricos que representan el significado del texto).
    Cuando alguien hace una pregunta, esa pregunta también se convierte en un embedding y se busca en la base de datos cuáles fragmentos son más parecidos semánticamente (no por palabras exactas, sino por significado).
    Los fragmentos más relevantes se le pasan al modelo de IA como contexto, junto con la pregunta.
    El modelo responde basándose en ese contexto real, en vez de inventar o depender solo de su memoria.

La ventaja es que el modelo puede "consultar" información específica y privada (tus propios documentos) sin necesidad de reentrenarlo.