Det korte svar

OCR genkender tekst i et billede eller dokument. Dokumentudtræk forbinder teksten med felter som dato, beløb og reference. AI kan hjælpe med variation i layout og formulering, men aflæste felter skal stadig kontrolleres.

Undersøg dokumentet før I vælger metode

En PDF kan indeholde digital tekst eller blot et scannet billede. Digital tekst kan ofte udtrækkes direkte, mens scanninger kræver tekstgenkendelse. Layout, tabeller og sidebrud kan stadig gøre det svært at forbinde teksten korrekt.

Saml et udvalg af de dokumenter, processen faktisk modtager. Medtag skæve scanninger, flere sider og forskellige leverandører. En demonstration på én pæn faktura siger lidt om et blandet indbakkegrundlag.

Adskil tekst, betydning og forretningskontrol

Et korrekt aflæst tal kan blive placeret i det forkerte felt. En total kan forveksles med et subtotalbeløb, eller kundens reference kan forveksles med leverandørens dokumentnummer. Vis derfor feltet sammen med den passage, det kom fra.

Forretningskontrollen er et tredje trin. Selv et korrekt aflæst kontonummer bør ikke automatisk ændre leverandørens betalingsoplysninger. Udtræk dokumenterer, hvad der står, ikke at indholdet er godkendt.

Adskil tekst, betydning og forretningskontrol
TrinSpørgsmål
TekstgenkendelseHvilke tegn står på siden?
FeltudtrækHvad betyder teksten i dokumentet?
ValideringStemmer feltet med relevante kilder og regler?
GodkendelseMå resultatet bruges til den ønskede handling?

Eksempel: en faktura med to beløbskolonner

En faktura viser enhedspris og linjebeløb i to kolonner. Hvis layoutet skifter, kan en løsning hente det rigtige tal fra den forkerte kolonne. En kontrol af antal gange pris mod linjebeløb kan synliggøre fejlen, når dokumenttypen understøtter den kontrol.

Gem den oprindelige side og markér det aflæste område i en gennemgang. Hvis teksten er ulæselig, kan den rigtige løsning være en bedre kopi fra leverandøren. En mere avanceret model gør ikke manglende billedinformation til et sikkert faktum.

Mål de felter, processen er afhængig af

Mål korrekthed for reference, beløb, dato og identitet hver for sig. En høj samlet tekstgenkendelse kan skjule fejl i netop det felt, som udløser en systemhandling. Microsoft anbefaler afprøvning på den konkrete anvendelse for at forstå kvalitet og konfidensværdier.

Udvid først til nye dokumenttyper, når de er afprøvet. Bevar en kø til usikre felter med en tydelig årsag. Det gør kontrollen hurtigere og giver et konkret grundlag for at forbedre udtrækket.

Brug det i praksis

Jeres næste skridt

  1. Skeln digital tekst fra scannede billeder.
  2. Test variation i layout og dokumentkvalitet.
  3. Vis felter sammen med deres kildested.
  4. Valider kritiske felter mod andre data.
  5. Mål kvalitet pr. felt og dokumenttype.

Ofte stillede spørgsmål

Er OCR og AI det samme?+

OCR er en opgave til tekstgenkendelse, som kan bruge maskinlæring. Dokumentforståelse og forretningsgodkendelse er yderligere trin.

Kan et dokument behandles uden en sprogmodel?+

Ja, hvis det har et egnet struktureret format eller kan håndteres med faste udtræk og kontroller.

Hvad gør vi med ulæselige bilag?+

Send dem til afklaring eller bed om en bedre kopi. Kritiske værdier bør ikke gættes.

Kilder og faglig baggrund

De praktiske eksempler og tjeklister er udarbejdet til denne guide. Følgende kilder uddyber de angivne faglige begreber.

Microsoft: Document Intelligence transparency note (åbner i ny fane)

Baggrund om dokumentudtræk, kvalitetsvariation og vurdering på den konkrete anvendelse.

Begreber i guiden

KonfidensOCR

Fra guiden til jeres arbejdsgang

Brug et afgrænset pilotforløb til at teste metoden på jeres data og undtagelser.

Sådan kommer I i gang med AI-automatisering
Om guiden

Udgivet af Norstream med AI-assisteret udarbejdelse. Eksempler er illustrative, medmindre andet er angivet. Tilpas metoder og kontroller til jeres systemer og faglige ansvar.

Har du en rettelse eller et spørgsmål?