Kontakta oss om ni har blanketter, ordersedlar, rapporter, avtal, anmälningssedlar, svarskort (kampanjer) eller liknande som ni snabbt vill konvertera till en databas.

Vi använder antingen teknik för datafångst i fasta formulär (samma som används för enkäter) eller flexibel datafångstteknik vid tolkning av formulär, då detta inte kräver styrmärken som normalt används vid fast formulärteknik, t. ex. enkäter.

Tolkning av formulär med flexibel datafångstteknik

Tolkning med flexibel datafångstteknik fungerar helt annorlunda än tolkning av fasta formulär, med referensmärken och fält i fasta positioner. Istället för tolkning i fasta positioner bygger det på att med OCR söka upp fördefinierade ankarord, som "Avtal", "avtalsnr", "Ordernr", "Ordersedel:", "Rapportnr:" eller liknande och därefter ställa upp villkor för sökning av lämplig teckensträng i ankarets närhet, eller åtminstone i relation till ankaret. Man ställer upp villkor för hur den sökta teckensträngen ska se ut, som antal tecken, vilka tecken som får förekomma etc. Se nedan ankarordet "RAPPORT" i blått och det fångade rapportnumret i grönt.

Flexibel datafångstteknik

Samma typ av avtal ser ju ofta likadana ut, men det räcker med att något av avtalen är i fotokopia, eller utskrivet på en annan skrivare, för att det inte längre ska passa ihop med en mall för fasta formulär, där kraven på millimeterprecision är höga. Ett bra exempel på när detta garanterat inträffar är om du lägger upp en PDF med exempelvis en anmälningssedel till en nyemission som sedan laddas ner av olika personer och denna PDF sedan skrivs ut på olika skrivare. Då är istället den flexibla datafångsttekniken för semistrukturerade formulär att föredra.

Datafångst med AI – alternativ och komplement till klassisk OCR

De senaste årens AI-modeller för bildtolkning har gett oss ett kraftfullt komplement till klassisk OCR och mallbaserad datafångst. Istället för att leta upp ankarord i fasta positioner läser AI:n sidan mer som en människa gör – den förstår vad ett fält betyder utifrån sammanhanget, även när blanketten ser annorlunda ut än förra gången. Det gör att vi kan ta oss an material som tidigare hade krävt manuell registrering.

När AI-läsning gör störst nytta

AI som kontrolläsare av OCR-tolkade data

Den kanske viktigaste användningen hos oss är AI:n som ett andra par ögon. Efter att data fångats med OCR eller datafångstteknik låter vi AI:n läsa om varje osäker uppgift direkt från den skannade bilden och jämföra med det som hamnat i databasen. Då fångar vi just de fel som är svårast att upptäcka maskinellt: siffran 1 läst som bokstaven l eller I, 0 som O, och sammanskrivna eller avhuggna ord.

Vi har byggt den här kontrollen för just den typ av korta datafält som blanketter innehåller – nummer, datum och belopp, men även namn, e-postadresser och kortare fritext. Varje osäker uppgift kontrolleras mot originalbilden innan leverans.

Alltid kontrollerat mot originalbilden

En AI-modell kan gissa fel, och en gissning som ser rimlig ut är farligare än ett uppenbart OCR-fel. Därför använder vi aldrig AI-läsning okontrollerat. Varje uppgift valideras dels deterministiskt mot regler vi ställer upp – antal tecken, tillåtna tecken, kontrollsiffra, uppslag mot register – dels visuellt mot den skannade bilden. Det som inte går att styrka mot bilden går vidare till manuell granskning.

Dessutom kombineras AI-datafångsten ofta med att jag själv går igenom svaren mot bilden med egna ögon i ett sista varv. Maskinell validering och AI-kontroll fångar det mesta, men det är i den sista genomgången de enstaka udda felen brukar dyka upp. Det är också därför jag vågar lova så hög noggrannhet på den här typen av uppdrag.

Vi väljer teknik efter materialet

Fast formulärteknik, flexibel datafångst och AI-läsning utesluter inte varandra – vi kombinerar dem ofta i samma uppdrag och låter varje teknik göra det den är bäst på. Skicka gärna några provsidor, t.ex. bilder tagna med mobilen, så återkommer vi med förslag på upplägg och pris.