Abans del Company Brain: checklist d’ingesta documental
Les comprovacions prèvies que eviten que mal OCR, versions incorrectes i fuites de permisos enverinin la capa d’automatització.
Les comprovacions prèvies que eviten que mal OCR, versions incorrectes i fuites de permisos enverinin la capa d’automatització.
La majoria de projectes de document AI no fallen a la capa de chatbot. Fallen abans: permisos desordenats, documents duplicats, OCR feble, manca de propietari, metadades pobres, fitxers obsolets i cap manera de provar quina versió s’ha utilitzat.
Abans de construir RAG, construeix disciplina d’ingesta.
Comença separant famílies documentals: polítiques, procediments, contractes, packs de comitè, evidències d’auditoria, manuals tècnics, factures, emails i PDFs escanejats. Cada família té estructura, retenció, propietaris i risc diferents.
No tractis tot el shared drive com un únic bloc. Una clàusula contractual, una excepció de política i una factura escanejada necessiten regles diferents de parsing i revisió.
Desa una còpia bruta immutable. Emmagatzema el text extret per separat. Registra versió del parser, motor OCR, idioma, nombre de pàgines, checksum, propietari, data de creació, modificació i ubicació original.
Si el text extret canvia perquè millores OCR o parsing, has de saber quina font va produir el resultat anterior.
Neteja capçaleres, peus, números de pàgina, boilerplate, guionets, taules i notes legals repetides. Conserva senyals de layout quan importen: títols, seccions, taules, clàusules, signatures i annexos.
Embeure text brut crea recuperació bruta. El model no compensa un corpus malmès durant la ingesta.
El chunking ha de respectar l’estructura del document. Les polítiques funcionen per secció. Els contractes per clàusula. Els manuals per procediment. Les taules necessiten tractament especial. Un tall cec de 1.000 tokens és simple, però pot partir l’evidència exacta per la meitat.
Cada chunk ha de portar metadades suficients: ID de document, versió, pàgina, ruta d’encapçalaments, número de clàusula, idioma, scope d’accés i política de retenció.
Fes servir preguntes reals. Inclou preguntes sense resposta, conflictes entre documents antics i nous, documents restringits per permisos i llenguatge ambigu. Mesura precisió de recuperació abans d’optimitzar l’LLM.
Lectures útils: sèrie d’enterprise document intelligence i patrons de procedència en enterprise RAG.
Com traçar respostes fins a l’evidència d’origen perquè auditoria, legal, direcció i agents confiïn en el que va dir el sistema.
Estructures pràctiques d’evidència per a governança d’IA, resiliència operativa i automatització controlada.
Per què les respostes amb fonts també fallen, i quins controls necessita un Company Brain abans que equips o agents actuïn.