Häufige Anforderungen an die Bild-OCR
- Text in einem Screenshot kopieren
- Abfotografierte Unterlagen in bearbeitbaren Text umwandeln
- Tabellen in einem Bild in Excel umwandeln
- Eingescannte Bücher digitalisieren
- Straßenschilder, fotografierte Menüs erkennen
Manuelles Abtippen ist langsam und fehleranfällig, OCR extrahiert den Text mit einem Klick — um ein Vielfaches effizienter.
Grundprinzip der OCR
OCR (optische Zeichenerkennung) identifiziert über Algorithmen die Form der Zeichen in einem Bild und wandelt sie in die entsprechenden Zeichen um. Moderne OCR verwendet KI-Modelle, deren Erkennungsrate deutlich über der traditioneller Algorithmen liegt.
Der Erkennungsablauf lautet etwa: Bildvorverarbeitung -> Textbereichserkennung -> Zeichenerkennung -> Nachbearbeitungskorrektur.
Faktoren, die die Erkennungsgenauigkeit beeinflussen
Bildschärfe
Am wichtigsten. Ein scharfes, großes Bild hat eine hohe Erkennungsrate, ein unscharfes, kleines Bild eine niedrige. Screenshots sind meist scharf mit hoher Erkennungsrate; Fotos können unscharf oder schattig sein, was die Rate beeinträchtigt.
Textgröße
Zu kleiner Text (wenige Pixel) ist schwer zu erkennen. Ideal ist eine Texthöhe ab 20 Pixel. Bei zu kleinem Text vorab vergrößern.
Hintergrundkontrast
Je stärker der Kontrast zwischen Text und Hintergrund, desto besser. Schwarz auf weißem Hintergrund ist optimal, Hellgrau auf Hellgrau ist schwer zu erkennen.
Schriftart
Standard-Druckschrift wird am besten erkannt. Handschrift, künstlerische Schriften, Zierschriften sind schwierig. Gemischter chinesisch-englischer Text und Sonderzeichen verringern ebenfalls die Genauigkeit.
Satzlayout
Reiner Fließtext ist am leichtesten zu erkennen. Tabellen, Spalten, gemischte Text-Bild-Anordnung und gedrehte Texte erhöhen die Schwierigkeit.
Techniken zur Verbesserung der Erkennungsgenauigkeit
Bild vorverarbeiten
- Kleine Bilder vergrößern: bei zu kleinem Text zuerst vergrößern
- Kontrast erhöhen: Text-Hintergrund-Kontrast deutlicher machen
- Rauschen reduzieren: Störungen verringern
- Neigung korrigieren: geneigter Text hat eine niedrige Erkennungsrate, zuerst drehen und korrigieren
- Binarisierung: in ein Schwarz-Weiß-Bild umwandeln, Text tritt deutlicher hervor
Bereichsweise erkennen
Komplexe Layouts bereichsweise erkennen, jeden Block einzeln behandeln, ergibt eine höhere Genauigkeit als die Erkennung des gesamten Bildes auf einmal.
Richtige Erkennungssprache wählen
Bei gemischtem chinesisch-englischem Text den Modus „Chinesisch-Englisch“ wählen, bei reinem Englisch „Englisch“, um Fehlinterpretationen durch eine falsche Spracheinstellung zu vermeiden.
Nach der Erkennung korrigieren
OCR ist nie zu 100 % genau. Nach der Erkennung unbedingt korrigieren, insbesondere prüfen:
- zeichnerisch ähnliche Zeichen (wie 0/O, 1/l/I)
- Ziffern und Buchstaben (5 und S, 2 und Z)
- Satzzeichen
- Fachbegriffe
OCR mit DocsAll durchführen
Das Bild-OCR-Werkzeug verarbeitet browserseitig:
- Bild hochladen
- Erkennungssprache wählen (Chinesisch, Englisch, gemischt Chinesisch-Englisch)
- Erkennung starten
- Erkannten Text kopieren
- Korrigieren und anpassen
Das Bild wird nicht auf einen Server hochgeladen, sensible Screenshots und Ausweisfotos bleiben geschützt.
Erkennungstipps für verschiedene Anwendungsfälle
Screenshot-Erkennung
Screenshots haben eine hohe Schärfe und die höchste Erkennungsrate. Direkt hochladen und erkennen.
Foto-Erkennung
Fotos können perspektivische Verzerrungen, Schatten oder Reflexionen aufweisen. Zuerst vorverarbeiten: Perspektive korrigieren, Kontrast anpassen, Schatten entfernen.
Tabellen-Erkennung
Tabellen-OCR ist eine Herausforderung; nach der Erkennung ist die Tabellenstruktur oft durcheinander. Einfache Tabellen lassen sich erkennen, bei komplexen Tabellen ein spezielles Werkzeug oder manuelles Nachbearbeiten erwägen.
Handschrift-Erkennung
Die Erkennungsrate für Handschrift ist gering; ordentliche Handschrift funktioniert noch, unleserliche Handschrift ist praktisch nicht erkennbar. Für wichtige handschriftliche Inhalte ist manuelle Erfassung genauer.
Ausweis-Erkennung
Bei der OCR von Ausweisen (Personalausweis, Führerschein) auf Datenschutz achten — ein lokal verarbeitendes Werkzeug verwenden, nicht auf einen unbekannten Server hochladen.
Häufige Fragen
Erkannter Text enthält Fehlinterpretationen
Falsche Sprache oder zu schlechte Bildqualität. Richtige Sprache wählen, Bildqualität verbessern.
Zeichen fehlen
Textbereiche wurden nicht vollständig erkannt oder ein Teil des Textes ist unscharf. Fehlende Stellen manuell ergänzen.
Layout verloren
OCR erkennt hauptsächlich Text, Formatierungen (Absätze, Einzüge, Ausrichtung) gehen oft verloren. Nach der Erkennung das Layout manuell anpassen.
Formeln, Sonderzeichen
Mathematische Formeln und Sonderzeichen sind schwer zu erkennen. Solche Inhalte nach der Erkennung sorgfältig korrigieren oder manuell eingeben.
Zusammenfassung
Der Kern der Bild-OCR lautet: „Die Bildqualität bestimmt die Obergrenze, Vorverarbeitung und Korrektur die Untergrenze.“ Ein scharfes, kontraststarkes Bild hat die höchste Erkennungsrate; unscharfe, kontrastarme Bilder müssen zuerst vorverarbeitet werden. Nach der Erkennung ist eine Korrektur unerlässlich, insbesondere bei ähnlichen Zeichen sowie Ziffern und Buchstaben. Die DocsAll-OCR läuft browserseitig, sensible Bilder werden nicht hochgeladen — sicherer.