Afbeelding comprimeren
Bestandsgrootte van afbeeldingen omlaag brengen.
Afbeelding
Tekst herkennen in foto's en scans met OCR.
OCR raadt niet alleen letters, het gebruikt ook een woordenlijst om te kiezen tussen tekens die op elkaar lijken.
Staat de taal op Engels terwijl je een Nederlandse brief scant, dan gaat dat mis op precies de plekken waar Nederlands afwijkt. De ij wordt ij of y of zelfs ÿ. Woorden met een trema — coördinatie, geïnteresseerd — worden verminkt. Lange samenstellingen worden opgeknipt omdat ze niet in de lijst staan.
Zet de taal dus op Nederlands. Dat scheelt meer dan welke andere instelling ook.
Bij een tweetalig document — een Nederlandse brief met Engelse bijlage — verwerk je de delen het beste apart. Eén taal per keer geeft een beter resultaat dan een instelling die beide probeert.
De invoer bepaalt vrijwel alles. Een slechte foto wordt niet gered door betere software.
| Werkt goed | Gaat mis |
|---|---|
| recht van boven gefotografeerd | schuine hoek |
| gelijkmatig licht | schaduw of flits |
| gedrukte tekst | handschrift |
| zwart op wit | tekst over een foto |
| 300 dpi of meer | kleine schermfoto |
| één kolom | kolommen en kaders door elkaar |
Handschrift is de duidelijkste grens. Gewone OCR is getraind op gedrukte letters; een handgeschreven brief levert onbruikbare uitvoer op, hoe scherp de foto ook is.
Tabellen zijn de tweede: de tekens worden meestal wel herkend, maar de indeling in rijen en kolommen gaat verloren. Reken erop dat je die met de hand terugzet.
OCR geeft geen foutmelding. Het levert altijd tekst, ook als die verkeerd is — en dat is precies waarom het risico groot is.
De klassieke verwisselingen zitten in cijfers: 0 en O, 1 en l en I, 5 en S, 8 en B. In lopende tekst valt dat op. In een rekeningnummer, een bedrag, een BSN of een kenteken valt het niet op, en daar richt het schade aan.
Controleer daarom altijd de cijfers met het origineel ernaast, ook als de rest er goed uitziet. Neem OCR-uitvoer nooit ongezien over in een betaling of een formulier.
De herkenning gebeurt op je eigen apparaat. Dat is bij dit soort documenten geen bijzaak: het gaat vaak juist om post, facturen en officiële stukken.
Ja, mits je Nederlands als taal instelt. Op Engels gaan ij en trema's mis.
Nee. Gewone OCR is getraind op gedrukte tekst.
Meestal een schuine foto, ongelijk licht of te lage resolutie. Fotografeer recht van boven op 300 dpi of meer.
De tekens meestal wel, de indeling niet. Reken op handwerk.
Niet zonder nalezen. Let vooral op 0/O en 1/l in rekeningnummers en bedragen.
Nee, de herkenning gebeurt lokaal.