Antes del Company Brain: checklist de ingesta documental
Las comprobaciones previas que evitan que mal OCR, versiones incorrectas y fugas de permisos envenenen tu capa de automatización.
Las comprobaciones previas que evitan que mal OCR, versiones incorrectas y fugas de permisos envenenen tu capa de automatización.
La mayoría de proyectos de document AI no fallan en la capa de chatbot. Fallan antes: permisos desordenados, documentos duplicados, OCR débil, falta de propietario, metadatos pobres, archivos obsoletos y ninguna forma de probar qué versión se usó.
Antes de construir RAG, construye disciplina de ingesta.
Empieza separando familias documentales: políticas, procedimientos, contratos, packs de comité, evidencias de auditoría, manuales técnicos, facturas, emails y PDFs escaneados. Cada familia tiene estructura, retención, propietarios y riesgo diferentes.
No trates todo el shared drive como un único bloque. Una cláusula contractual, una excepción de política y una factura escaneada necesitan reglas distintas de parsing y revisión.
Guarda una copia bruta inmutable. Almacena el texto extraído por separado. Registra versión del parser, motor OCR, idioma, número de páginas, checksum, propietario, fecha de creación, modificación y ubicación original.
Si el texto extraído cambia porque mejoras OCR o parsing, debes saber qué fuente produjo el resultado anterior.
Limpia cabeceras, pies, números de página, boilerplate, guiones, tablas y notas legales repetidas. Conserva señales de layout cuando importan: títulos, secciones, tablas, cláusulas, firmas y anexos.
Embeber texto sucio crea recuperación sucia. El modelo no compensa un corpus roto durante la ingesta.
El chunking debe respetar la estructura del documento. Las políticas funcionan por sección. Los contratos por cláusula. Los manuales por procedimiento. Las tablas necesitan tratamiento especial. Un corte ciego de 1.000 tokens es simple, pero puede partir la evidencia exacta por la mitad.
Cada chunk debe llevar metadatos suficientes: ID de documento, versión, página, ruta de encabezados, número de cláusula, idioma, scope de acceso y política de retención.
Usa preguntas reales. Incluye preguntas sin respuesta, conflictos entre documentos antiguos y nuevos, documentos restringidos por permisos y lenguaje ambiguo. Mide precisión de recuperación antes de optimizar el LLM.
Lecturas útiles: serie de enterprise document intelligence y patrones de procedencia en enterprise RAG.
Una explicación práctica de la capa que falta entre el conocimiento disperso de la empresa y una automatización con IA fiable.
Cómo elegir modelos open source, propietarios o self-hosted cuando el activo real es conocimiento empresarial gobernado.
Por qué los resúmenes de IA necesitan evidencia de origen, frescura y revisión antes de convertirse en conocimiento operativo.