Skip to content
Leon Achata
Todos los proyectos
RAG

Local RAG Agent

Preguntas con citas sobre tus propios archivos que corre completamente en tu máquina: sin API keys, sin enviar nada a ningún lado.

El problema

Muchas organizaciones no pueden enviar sus documentos a un modelo en la nube, pero necesitan respuestas sobre reglamentos y políticas largas, con el artículo exacto citado.

Cómo funciona

Los documentos se leen con sus páginas y tablas, se dividen según su estructura (artículos, capítulos, anexos) y se indexan en ChromaDB. Cada pregunta corre búsqueda vectorial y BM25 en paralelo, fusionadas con RRF y opcionalmente reordenadas, y un modelo local en Ollama responde citando archivo y página. La reindexación es incremental y una evaluación integrada reporta Hit@k y MRR.

Pipeline

  1. 01Carga
  2. 02Limpieza
  3. 03Chunking por estructura
  4. 04Búsqueda híbrida
  5. 05LLM local + citas

Dónde se usa

  • Construido como asistente en español para el reglamento de la beca nacional Beca 18
  • Instituciones públicas y ONGs que responden consultas sobre normativa
  • Cualquier equipo cuyos documentos deben quedarse en sus propios equipos

Puntos clave

  • Totalmente offline con Ollama, ningún dato sale de la máquina
  • Chunking que entiende normas y mantiene cada artículo entero, con su ruta
  • Respuesta de rechazo fija cuando no se recupera nada relevante
  • Reindexación incremental y evaluación de recuperación integrada (Hit@k, MRR)

Stack

OllamaChromaDBBM25Cross-encoderPython

¿Quieres algo así para tu empresa?

Construyo versiones de producción de estos sistemas sobre tus datos y tu infraestructura.

Servicio relacionado: Asistentes de conocimiento

Contáctame