Tornar al blog
Published· Minerva Data Solutions

Abans del Company Brain: checklist d’ingesta documental

Les comprovacions prèvies que eviten que mal OCR, versions incorrectes i fuites de permisos enverinin la capa d’automatització.

document AIingestionknowledge management

La majoria de projectes de document AI no fallen a la capa de chatbot. Fallen abans: permisos desordenats, documents duplicats, OCR feble, manca de propietari, metadades pobres, fitxers obsolets i cap manera de provar quina versió s’ha utilitzat.

Abans de construir RAG, construeix disciplina d’ingesta.

1. Classifica el corpus

Comença separant famílies documentals: polítiques, procediments, contractes, packs de comitè, evidències d’auditoria, manuals tècnics, factures, emails i PDFs escanejats. Cada família té estructura, retenció, propietaris i risc diferents.

No tractis tot el shared drive com un únic bloc. Una clàusula contractual, una excepció de política i una factura escanejada necessiten regles diferents de parsing i revisió.

2. Conserva la font de veritat

Desa una còpia bruta immutable. Emmagatzema el text extret per separat. Registra versió del parser, motor OCR, idioma, nombre de pàgines, checksum, propietari, data de creació, modificació i ubicació original.

Si el text extret canvia perquè millores OCR o parsing, has de saber quina font va produir el resultat anterior.

3. Normalitza abans d’embedir

Neteja capçaleres, peus, números de pàgina, boilerplate, guionets, taules i notes legals repetides. Conserva senyals de layout quan importen: títols, seccions, taules, clàusules, signatures i annexos.

Embeure text brut crea recuperació bruta. El model no compensa un corpus malmès durant la ingesta.

4. Fragmenta per significat, no per mida arbitrària

El chunking ha de respectar l’estructura del document. Les polítiques funcionen per secció. Els contractes per clàusula. Els manuals per procediment. Les taules necessiten tractament especial. Un tall cec de 1.000 tokens és simple, però pot partir l’evidència exacta per la meitat.

Cada chunk ha de portar metadades suficients: ID de document, versió, pàgina, ruta d’encapçalaments, número de clàusula, idioma, scope d’accés i política de retenció.

5. Valida abans de llançar

Fes servir preguntes reals. Inclou preguntes sense resposta, conflictes entre documents antics i nous, documents restringits per permisos i llenguatge ambigu. Mesura precisió de recuperació abans d’optimitzar l’LLM.

Lectures útils: sèrie d’enterprise document intelligence i patrons de procedència en enterprise RAG.