RAG en producción: el verdadero desafío de leer PDFs en el mundo real
Los sistemas de Recuperación Aumentada por Generación (RAG, por sus siglas en inglés) han ganado enorme popularidad como solución para que los modelos de lenguaje respondan preguntas basadas en documentos propios de una organización. Sin embargo, existe una brecha crítica entre los demos que funcionan perfectamente con PDFs limpios y lo que ocurre cuando se enfrenta a documentos reales: contratos legales con tablas complejas, expedientes técnicos con columnas mal alineadas, formularios gubernamentales escaneados o reportes financieros con encabezados anidados. Este es el problema central que aborda el enfoque de pipeline RAG de producción para PDFs del mundo real.
En el contexto peruano, esta problemática es especialmente relevante. Entidades como la SUNAT, el Ministerio de Economía, OSCE, Indecopi y los gobiernos regionales publican miles de documentos en PDF cada año: bases de licitación, resoluciones, informes de auditoría, marcos normativos y más. Empresas privadas, estudios de abogados, clínicas, universidades y startups fintech manejan volúmenes crecientes de documentos digitales que necesitan ser consultados de manera rápida y confiable. Un pipeline RAG mal implementado en estos entornos no solo da respuestas incorrectas, sino que puede generar consecuencias legales o financieras graves.
El problema con el RAG naive y los PDFs complejos
La aproximación más común al RAG consiste en extraer el texto de un PDF, dividirlo en fragmentos (chunks) de tamaño fijo, indexarlos en una base vectorial y recuperar los más similares a la consulta del usuario. Este enfoque falla en escenarios reales porque ignora la estructura del documento. Un párrafo que tiene sentido solo dentro de una tabla puede ser recuperado sin su contexto tabular, generando respuestas ambiguas o directamente erróneas. Además, los metadatos como número de página, sección o encabezado se pierden, haciendo imposible citar la fuente exacta.
El pipeline de producción propuesto resuelve esto mediante recuperación estructural: en lugar de tratar el PDF como una secuencia plana de texto, se analiza su jerarquía. Se identifican títulos, subtítulos, párrafos, tablas, listas y notas al pie como elementos distintos con relaciones entre sí. Cada fragmento indexado conserva metadatos estructurales que permiten reconstruir su contexto original. Esto es fundamental para documentos como los contratos de concesión minera en Perú o los expedientes de obras públicas, donde una cláusula solo tiene significado dentro de su artículo y sección específicos.
Respuestas tipadas: más allá del texto libre
Otro avance clave es el concepto de respuestas tipadas. En lugar de que el modelo de lenguaje devuelva siempre texto libre, el sistema define esquemas de respuesta según el tipo de pregunta: fechas, montos en soles o dólares, nombres de entidades, porcentajes, listas de ítems, respuestas booleanas (sí/no con justificación). Esto permite integrar los resultados directamente en flujos de trabajo automatizados, formularios digitales o dashboards sin necesidad de posprocesamiento manual.
Para equipos de tecnología en empresas peruanas que están construyendo asistentes internos o herramientas de compliance, las respuestas tipadas representan una diferencia enorme en la confiabilidad del sistema. Un bot que responde con un monto exacto validado es infinitamente más útil que uno que genera una descripción vaga sobre precios.
Citas verificables: el pilar de la confianza
El tercer componente del pipeline es la generación de citas de línea verificables. Cada respuesta del sistema incluye la referencia exacta al fragmento del PDF del que proviene: número de página, párrafo o fila de tabla. Esto permite al usuario humano verificar la respuesta en segundos, construyendo confianza en el sistema y cumpliendo con estándares de auditoría. En un país donde la transparencia documental en procesos públicos es un tema sensible, esta característica tiene valor estratégico inmediato para organismos de control, estudios jurídicos y equipos de auditoría interna.
Implementar este tipo de pipeline en Perú requiere considerar también el soporte para documentos en español, el manejo de caracteres especiales del idioma y la capacidad de procesar PDFs generados por sistemas legados del Estado. Los equipos de ingeniería local tienen la oportunidad de adaptar estas arquitecturas a sus necesidades específicas, posicionándose a la vanguardia de la automatización documental en la región.