Abans de Document Operations: checklist d’ingesta documental
Les comprovacions prèvies que eviten que mal OCR, versions incorrectes i fuites de permisos enverinin la capa d’automatització.
- document AI
- ingestion
- knowledge management
La majoria de projectes de document AI no fallen a la capa de chatbot. Fallen abans: permisos desordenats, documents duplicats, OCR feble, manca de propietari, metadades pobres, fitxers obsolets i cap manera de provar quina versió s’ha utilitzat.
Abans de construir RAG, construeix disciplina d’ingesta.
1. Classifica el corpus
Comença separant famílies documentals: polítiques, procediments, contractes, packs de comitè, evidències d’auditoria, manuals tècnics, factures, emails i PDFs escanejats. Cada família té estructura, retenció, propietaris i risc diferents.
No tractis tot el shared drive com un únic bloc. Una clàusula contractual, una excepció de política i una factura escanejada necessiten regles diferents de parsing i revisió.
2. Conserva la font de veritat
Desa una còpia bruta immutable. Emmagatzema el text extret per separat. Registra versió del parser, motor OCR, idioma, nombre de pàgines, checksum, propietari, data de creació, modificació i ubicació original.
Si el text extret canvia perquè millores OCR o parsing, has de saber quina font va produir el resultat anterior.
3. Normalitza abans d’embedir
Neteja capçaleres, peus, números de pàgina, boilerplate, guionets, taules i notes legals repetides. Conserva senyals de layout quan importen: títols, seccions, taules, clàusules, signatures i annexos.
Embeure text brut crea recuperació bruta. El model no compensa un corpus malmès durant la ingesta.
4. Fragmenta per significat, no per mida arbitrària
El chunking ha de respectar l’estructura del document. Les polítiques funcionen per secció. Els contractes per clàusula. Els manuals per procediment. Les taules necessiten tractament especial. Un tall cec de 1.000 tokens és simple, però pot partir l’evidència exacta per la meitat.
Cada chunk ha de portar metadades suficients: ID de document, versió, pàgina, ruta d’encapçalaments, número de clàusula, idioma, scope d’accés i política de retenció.
5. Valida abans de llançar
Fes servir preguntes reals. Inclou preguntes sense resposta, conflictes entre documents antics i nous, documents restringits per permisos i llenguatge ambigu. Mesura precisió de recuperació abans d’optimitzar l’LLM.
Lectures útils: sèrie d’enterprise document intelligence i patrons de procedència en enterprise RAG.
Articles relacionats
Què són les Document Operations?
Una explicació pràctica dels fluxos documentals recurrents que necessiten fonts, comprovacions, revisió humana i resultats reutilitzables—no un altre chatbot sobre fitxers.
Cada resposta governada necessita proves
Com traçar respostes fins a l’evidència d’origen perquè auditoria, legal, direcció i agents confiïn en el que va dir el sistema.
Paquets d’evidència de Document Operations per a EU AI Act i DORA
Estructures pràctiques d’evidència per a governança d’IA, resiliència operativa i automatització controlada.

