Projektas · Procesų automatizavimas
PDF dokumentų nuskaitymo ir duomenų perkėlimo sistema
Automatizuotas sprendimas, kuris paima PDF dokumentus iš vienos sistemos, atpažįsta jų turinį, ištraukia reikalingą informaciją ir kartu su originaliais dokumentais perkelia ją į kitą vidinę sistemą.
Procesų automatizavimas
PDF duomenų išgavimas ir sistemų integracija
Java, Spring Boot, Selenium, Tesseract OCR, REST API
01 · Situacija
PDF dokumentus reikėjo reguliariai peržiūrėti ir apdoroti rankiniu būdu.
Darbuotojai turėdavo prisijungti prie vidinės sistemos, surasti naujus PDF dokumentus, juos atsidaryti ir pagal dokumentuose pateiktą informaciją rankiniu būdu užpildyti įrašus kitoje sistemoje.
Kartu reikėjo perkelti ir patį dokumentą. Procesas kartojosi nuolat, reikalavo darbuotojo dėmesio ir kiekvienam dokumentui teko atlikti tuos pačius veiksmus.
Reikėjo automatizuoti ne vien dokumento nuskaitymą, o visą procesą – nuo naujo PDF failo paėmimo iki atpažintų duomenų ir originalaus dokumento atsiradimo kitoje sistemoje.
02 · Sprendimas
Dokumentai perskaitomi, apdorojami ir perkeliami automatiškai.
Sukurtas procesas periodiškai pasiekia vidinę sistemą ir paima reikalingus PDF dokumentus.
Sistema nustato, kaip dokumentą reikia apdoroti, iš jo išgauna reikalingą informaciją, susistemina duomenis pagal tikslinės sistemos struktūrą ir perduoda juos tolesniam naudojimui.
Paėmimas
Sistema pasiekia šaltinį ir atsisiunčia naujus PDF dokumentus.
Atpažinimas
Nustatoma dokumento kalba, turinio tipas ir tinkamas nuskaitymo būdas.
Duomenų išgavimas
Iš lentelių ir tekstinių dokumento dalių ištraukiama reikalinga informacija.
Perkėlimas
Duomenys perduodami į kitą sistemą, o prie įrašo išsaugomas originalus PDF dokumentas.
03 · Ne visi PDF vienodi
Sistema turėjo prisitaikyti prie skirtingų dokumentų, o ne vieno šablono.
Dokumentai buvo keliomis kalbomis ir skyrėsi savo struktūra. Vienuose reikalinga informacija pateikta lentelėse, kituose – tekstinėse dokumento dalyse, todėl nebuvo galima remtis vien fiksuotomis koordinatėmis ar viena nekintančia dokumento struktūra.
Dalis PDF dokumentų taip pat neturėjo tekstinio sluoksnio. Tokiais atvejais informacijos nebuvo galima tiesiog paimti programiškai iš PDF turinio – pirmiausia reikėjo ją atpažinti.
Sistema todėl turėjo identifikuoti dokumento ypatybes ir pasirinkti tinkamą jo apdorojimo kelią prieš pradedant išgauti konkrečius duomenis.
04 · Sudėtingiausia dalis
Patikimas daugiakalbių ir skirtingos struktūros dokumentų atpažinimas.
Viena sudėtingiausių projekto dalių buvo dokumentų kalbos identifikavimas ir tinkamo nuskaitymo būdo parinkimas. Dokumentai galėjo būti pateikti skirtingomis kalbomis, todėl prieš apdorojimą reikėjo nustatyti, kokią kalbą naudoti atpažinimui.
Ypač daug tikslinimo reikėjo lietuvių kalbos dokumentams. Atpažinimo nustatymai buvo kalibruojami taip, kad lietuviškas tekstas, specialieji simboliai ir dokumentuose pateikiami duomenys būtų nuskaitomi kuo tiksliau.
Papildomą sudėtingumą kūrė ir nevienoda dokumentų struktūra: reikalingi duomenys galėjo būti pateikti lentelėse, atskirose teksto dalyse ar skirtingose dokumento vietose.
- atskirti PDF dokumentus su tekstiniu sluoksniu ir be jo;
- identifikuoti dokumento kalbą ir pritaikyti tinkamą atpažinimą;
- sukalibruoti lietuviško teksto nuskaitymą didesniam tikslumui;
- apdoroti keliomis kalbomis pateiktus dokumentus;
- išgauti informaciją tiek iš lentelių, tiek iš tekstinių dokumento dalių;
- atpažintus duomenis susieti su konkrečiais kitos sistemos laukais;
- kartu su struktūrizuotais duomenimis išsaugoti originalų dokumentą.
05 · Rezultatas
Rankinis skirtingų PDF dokumentų apdorojimas pakeistas automatizuotu procesu.
Darbuotojams nebereikia nuolat tikrinti sistemos, atsidarinėti dokumentų ir rankiniu būdu ieškoti bei perrašinėti juose esančios informacijos.
Sistema pati paima dokumentus, parenka jų apdorojimo būdą, išgauna reikalingus duomenis ir perduoda juos į kitą vidinę sistemą. Kartu išsaugomas ir originalus PDF dokumentas.
Taip pašalintas pasikartojantis rankinis dokumentų apdorojimas, sumažinta duomenų perrašymo klaidų tikimybė ir sukurtas procesas, galintis dirbti su skirtingomis dokumentų kalbomis bei struktūromis.
Techninis pagrindas
Naudotos technologijos
Java
Spring Boot
Selenium
Tesseract OCR
REST API
Susijusios paslaugos
Panašiems sprendimams
Kitas projektas
Individualaus veiksmų plano generatorius →Turite panašų dokumentų procesą?
PDF dokumentų nebūtina apdoroti rankiniu būdu.
Jei komanda reguliariai gauna dokumentus, iš jų ieško konkrečių duomenų ir perkelia informaciją į kitą sistemą, galima automatizuoti ne vien nuskaitymą, bet ir visą tolimesnį procesą.