Firemná AI & agentiPráve tuVývoj mobilných appiek
Automatizácia

Ako dostať údaje z PDF do systému bez prepisovania: OCR, šablóny alebo AI?

Autor

Patrik Sabol

Ako dostať údaje z PDF do systému bez prepisovania: OCR, šablóny alebo AI?

Ak chcete dostať údaje z PDF do systému bez prepisovania, máte tri cesty: OCR, ktoré premení obrázok na text, šablóny, ktoré z textu vyberú polia na známych miestach, a AI, ktorá dokument číta podľa významu. Ktorá je správna, nerozhoduje technológia, ale vaše dokumenty — koľko typov, od koľkých partnerov a v akej kvalite.

Stručná odpoveď: pár typov dokumentov v pevnom formáte zvládnu šablóny lacno a spoľahlivo. Keď chodia zmluvy, dodacie listy, CMR, atesty a excely od desiatok partnerov, každý inak, šablóny sa nedajú udržať a vyťažovanie údajov z dokumentov dáva zmysel robiť cez AI — s kontrolami a s človekom na nejasné prípady. A v oboch prípadoch platí: presnosť sa meria na vašej vzorke, nie na deme.

Čo sa dnes vo firmách prepisuje

Faktúry sú najznámejší prípad a venovali sme im samostatný článok. Väčšina ručného prepisovania dokumentov je však inde — a práve tam sa automatické spracovanie dokumentov oplatí najviac:

  • zmluvy a dodatky — zmluvná strana, dátum účinnosti, výpovedná lehota, ceny,
  • dodacie listy a CMR — odosielateľ, príjemca, položky, hmotnosti, podpisy,
  • certifikáty a atesty — šarža, norma, namerané hodnoty, platnosť,
  • objednávkové formuláre, žiadosti a výkazy práce,
  • excely a reporty od partnerov — každý s vlastnými stĺpcami a názvami.

Spoločné majú to, že údaje v nich existujú, len nie v podobe, ktorú váš systém prijme. Niekto ich teda číta a prepisuje pole po poli.

Tri cesty, ako dostať údaje z PDF do systému: OCR, šablóny, AI

OCR (rozpoznávanie znakov) je to, čo si väčšina ľudí pod extrakciou dát z PDF predstaví: urobí zo skenu text. Nič viac. Nevie, že „Dátum účinnosti“ je iný údaj než „Dátum podpisu“, ani že tabuľka pokračuje na ďalšej strane. Je to nutný krok pri skenoch, ale samo o sebe nič do systému nezapíše.

Šablóny nad OCR hovoria „číslo zmluvy je vpravo hore, suma v treťom stĺpci“. Pri dokumentoch z jedného systému v stále rovnakom rozložení je to najlacnejšie a veľmi spoľahlivé riešenie. Každý nový partner či zmena rozloženia však znamená novú šablónu — a šablóna, ktorá prestala sedieť, často nespadne, ale potichu vyťaží nesprávne pole.

AI (multimodálne jazykové modely) číta dokument ako celok a hľadá údaje podľa významu. Nepotrebujete povedať, kde je výpovedná lehota, stačí povedať, že ju chcete. Preto zvládne aj partnera, ktorého ste doteraz nevideli. Slabina: model odpovie vždy, aj keď si nie je istý. Bez kontrol okolo sa preto nesmie púšťať priamo do systému.

OCRŠablóny nad OCRAI s kontrolami
Nový partner alebo rozloženie—nová šablónazvyčajne bez nastavenia
Rozumie súvislostiamnienieáno
Tabuľka cez viac stránnieťažkoáno, ak je dokument spracovaný ako celok
Údržbanízkarastie s počtom šablónmeranie presnosti a úprava definícií
Kedy stačíako medzikrok pri skenochpár pevných formátovveľa typov a partnerov

Ktoré dokumenty sú ľahké a ktoré ťažké

Od čistého PDF po pokrčený sken: niektoré dokumenty sú ľahké, iné ťažké

Presnosť vyťažovania údajov z PDF sa nelíši ani tak medzi nástrojmi, ako medzi dokumentmi. V praxi to vyzerá takto:

Ľahké: PDF vygenerované priamo zo systému (textová vrstva, žiadny sken), jednostranové formuláre, excely s jasnými hlavičkami. Tu býva presnosť na úrovni polí veľmi vysoká pri každej rozumnej ceste.

Stredne ťažké: dobré skeny tlačených dokumentov, zmluvy s dlhým voľným textom, kde treba nájsť jednu vetu o výpovednej lehote, excely, kde partner raz za čas pridá stĺpec.

Ťažké:

  • tabuľky cez viac strán — hlavička na prvej strane, riadky na tretej, medzisúčty uprostred,
  • rukopis — ručne vyplnené formuláre a CMR; tlačený dokument s ručnou poznámkou je ešte v poriadku, celý rukopis býva na hranici,
  • zlé skeny a fotky — šikmo, s tieňom, pečiatka cez text, fax z roku 2009,
  • viac dokumentov v jednom PDF — dvadsať dodacích listov naskenovaných do jedného súboru, ktoré treba najprv rozdeliť.

Pri ťažkých dokumentoch nie je cieľom stopercentná presnosť, ale to, aby systém vedel povedať „tu si nie som istý“ a poslal dokument človeku.

Presnosť: ako ju zmerať na vlastnej vzorke

„Naše riešenie má presnosť 98 %“ je číslo, ktoré bez kontextu nič neznamená. Merať treba takto:

  1. Zoberte 100–200 reálnych dokumentov z posledných mesiacov, v pomere, v akom naozaj chodia — vrátane zlých skenov.
  2. Pripravte správne odpovede. Človek ku každému dokumentu vyplní polia, ktoré chcete vyťažiť. Je to hodina–dve práce na desiatky dokumentov a bez nej sa nedá nič tvrdiť.
  3. Merajte po poliach, nie po dokumentoch. Dokument s 15 poliami, z ktorých jedno je zle, je v štatistike „správne na 93 %“, ale v systéme je chybný.
  4. Sledujte zvlášť kritické polia. Zlé číslo šarže je horšie než zlá poznámka.
  5. Porovnajte s ručným prepisom. Aj človek sa mýli. Cieľ je byť presnejší a rýchlejší než dnes, nie dokonalý.

Najdôležitejšie nakoniec nie je jedno číslo presnosti, ale dve: podiel dokumentov, ktoré prejdú bez zásahu, a počet chýb, ktoré prešli kontrolami nepovšimnuté — to druhé má byť čo najbližšie k nule. Tú istú vzorku potom používate po každej zmene — rovnako ako pri akomkoľvek AI projekte, ktorý má dobehnúť do produkcie.

Kontrola človekom: kde a ako

Nejasné dokumenty idú človeku na kontrolu, ostatné do systému

Riešenie, ktoré zapíše všetko, čo prečíta, vám ušetrí prepisovanie a pridá hľadanie chýb. Preto sa pred zápis dávajú kontroly:

  • formálne — IČO má správny tvar, dátum existuje, šarža zodpovedá vzoru,
  • vecné — súčty sedia, hmotnosť na CMR zodpovedá dodaciemu listu,
  • voči systému — taký zákazník, objednávka či materiál v ERP alebo CRM existuje,
  • prah istoty — pole, pri ktorom si model nie je istý, ide na kontrolu.

Dokument, ktorý neprejde, skončí vo fronte, kde človek vidí originál a vyťažené údaje vedľa seba a opraví ich jedným klikom. Pri rôznorodých dokumentoch je realistické, že na kontrolu pôjde 15–30 % prípadov. To nie je zlyhanie, to je dôvod, prečo sa systému dá veriť.

Kedy stačí existujúci nástroj

Poctivo: vlastné riešenie netreba vždy.

  • Máte pár desiatok dokumentov mesačne. Prepis trvá pár hodín mesačne a projekt sa nevráti.
  • Všetko chodí v jednej či dvoch pevných šablónach. OCR so šablónami alebo hotová služba na digitalizáciu dokumentov to zvládne lacnejšie.
  • Partner vie poslať dáta priamo — export, EDI, API. Vtedy dokument vôbec nečítajte a dohodnite sa na formáte.
  • Ide len o faktúry a váš účtovný program má vyťažovanie faktúr zabudované. Vyskúšajte ho najprv.

Vlastné riešenie dáva zmysel, keď je dokumentov stovky mesačne, chodia v mnohých typoch a rozloženiach a údaje z nich treba overiť voči vašim systémom. Ako to u nás vyzerá, sme rozpísali na stránke vyťažovanie údajov z dokumentov.

Koľko to stojí

Orientačne, bez DPH, pre malú a strednú firmu: analýza typov dokumentov a vzorky 900–1 800 €, pilot na reálnych dokumentoch 3 500–6 500 €, produkčné nasadenie s napojením na ERP alebo CRM 6 000–14 000 €, prevádzka od 290 € mesačne plus spotreba modelu (pri stovkách dokumentov mesačne rádovo jednotky až desiatky eur). Pri typickom objeme stoviek dokumentov mesačne počítame s návratnosťou rádovo do roka. Širšie súvislosti rozpočtu sú v článku koľko stojí AI riešenie pre firmu.

Zhrnutie

  • OCR je medzikrok pri skenoch, nie riešenie.
  • Šablóny stačia pri pár pevných formátoch; pri desiatkach partnerov sa nedajú udržať.
  • AI číta podľa významu a zvládne nové rozloženia, ale potrebuje kontroly a prah istoty.
  • Ťažké sú tabuľky cez viac strán, rukopis a zlé skeny — tam je cieľom priznať neistotu, nie hádať.
  • Presnosť merajte po poliach na vlastnej vzorke a porovnajte ju s ručným prepisom.
  • Pri malom objeme alebo pevnom formáte stačí existujúci nástroj.

Čo by sa dalo automatizovať u vás? Povedzte nám, ktoré dokumenty sa dnes prepisujú a koľko ich je za mesiac — na krátkom stretnutí vám povieme, ktorá cesta dáva zmysel, aj keby to mal byť existujúci nástroj.

Zdieľajte príspevok:

Čo by sa dalo automatizovať u vás?

Nemusíte vedieť, či potrebujete AI agenta, automatizáciu alebo prepojenie systémov. Opíšte nám proces, ktorý vás najviac zdržuje — povieme vám, čo sa dá automatizovať a či sa to oplatí.

Ozvite sa nám — a ak sa vám AI vo vašom prípade neoplatí, povieme vám to na rovinu.

Chcem prebrať svoj proces
Ako dostať údaje z PDF do systému bez prepisovania: OCR, šablóny alebo AI? | Grow-AI