Volver al Portafolio
Production Ready

Wha-RAG

Un sistema de Recuperación Aumentada por Generación (RAG) especializado para la indexación y consulta semántica de la enciclopedia de Witch Hat Atelier. Estructura una base de conocimientos local de texto plano en un índice vectorial rápido y autogestionado.

Flujo del Pipeline RAG

Interactúa con las fases del procesamiento para analizar cómo se formatea y recupera la información.

1. Ingesta de Documentos y Chunking
2. Generación de Embeddings
3. Búsqueda Híbrida (Vector + BM25)
4. Formateo e Inyección de Contexto

1. Ingesta de Documentos y Chunking

Directorio: /home/ubuntu/wha-rag/

El sistema procesa y segmenta la base de conocimientos estructurada en archivos Markdown plano que cubren el lore de Witch Hat Atelier (Capítulos 1 al 33).

Características principales:

  • Estructura Limpia: Indexa archivos Markdown temáticos dedicados a personajes, organizaciones, magia, hechizos y el anime (eps 1-7).
  • Segmentación por Encabezados (Chunking): Divide los documentos en base a etiquetas jerárquicas (#, ##, ###) para asegurar que el contexto semántico de cada entidad no se fragmente de forma aleatoria.
  • Preservación de Metadatos: Cada fragmento (chunk) se etiqueta con el nombre del archivo fuente y jerarquía para dar trazabilidad al origen de la respuesta.

Componentes del Stack

Capa Módulo / Tecnología Función del Stack
Knowledge Base Markdown (7 archivos estructurados) Enciclopedia de lore indexable (Atelier, hechizos, etc.)
Almacén Vectorial ChromaDB / SQLite SQLite-vec Indexación vectorial local persistente
Modelo Vectorial all-MiniLM-L6-v2 (HuggingFace) Generación local de embeddings de 384 dimensiones
Búsqueda Híbrida Cosine Similarity + BM25 Combina cercanía semántica y coincidencia exacta de palabras
Lógica de Respuesta Prompt Engineering Context Formatter Lógica de inyección directa y fallback paramétrico del LLM

Principios de Diseño RAG

  • Respuestas ultra-acotadas (1-3 líneas)

    El pipeline fuerza un formateador de prompt que obliga al LLM a dar respuestas sintéticas en español de forma directa. Elimina el preámbulo explicativo y se enfoca en resolver la duda de inmediato.

  • Fallback de Conocimiento Paramétrico

    Si la búsqueda en la base de datos local no devuelve puntuaciones (scores) por encima del umbral mínimo de similitud, el sistema instruye al modelo a responder con su conocimiento general sobre el manga/anime, indicando que el dato no está en la base indexada.

  • Indexación Eficiente de Lore Local

    A diferencia de los RAGs corporativos pesados en nube, Wha-RAG se despliega de forma local en el VPS, reduciendo el consumo de memoria RAM y permitiendo búsquedas KNN inmediatas sin dependencias externas de red.