Gescannte PDFs durchsuchbar machen
Ein Scan enthält häufig nur Seitenbilder. OCR erkennt darin Schrift und ermöglicht die Textsuche. Ein durchsuchbares Ergebnis bedeutet nicht, dass jedes Wort richtig erkannt wurde. Schlechte Kopien und Handschrift benötigen besondere Kontrolle.
Schritt für Schritt
- Möglichst klare, gerade Originalscans verwenden.
- Die Hauptsprache des Dokuments auswählen.
- Ein bekanntes Wort suchen und Zahlen mit dem Original vergleichen.
Beispielszenario
In einem archivierten Bericht lässt sich nach OCR ein Firmenname suchen. Wird er nicht gefunden, kann er falsch erkannt worden sein. Prüfen Sie die betreffende Seite visuell, bevor Sie sein Fehlen annehmen.
Ergebnis prüfen
Schiefe Seiten, Flecken, Schatten und niedrige Auflösung verschlechtern die Erkennung. Vor OCR nicht stark komprimieren. Daten, Kontonummern und Beträge sorgfältig prüfen. Bearbeitbare Word-Texte oder Excel-Tabellen benötigen anschließend eine gesonderte Umwandlung.
Häufige Fragen
Ist das Ergebnis eine Word-Datei?
Nein, dieses Werkzeug liefert PDF.
Wird Handschrift sicher erkannt?
Nein, Handschrift kann in diesem Ablauf unzuverlässige Ergebnisse liefern.
Werkzeug öffnen: PDF-Texterkennung →
Vor der Verarbeitung eine Originalkopie behalten. Beispiele dienen der Erklärung; Ergebnisse hängen vom Dokument ab.