Warum PDF zu Excel
Daten in PDF-Tabellen möchte man bearbeiten, berechnen, analysieren, aber im PDF lassen sie sich nicht ändern. In Excel konvertiert kann man Formeln verwenden, Diagramme erstellen, sortieren und filtern.
Häufige Fälle:
- Datenextraktion aus Finanzberichten
- Erfassung statistischer Daten
- Sortierung von Rechnungsinformationen
- Zusammenfassung von Umfragedaten
Typen von PDF-Tabellen
Textbasierte Tabelle
Der Text der Tabelle im PDF ist eine Textebene (markier- und kopierbar). Die Konvertierung ist relativ einfach: Text extrahieren + Tabellenstruktur erkennen.
Gescannte Tabelle
Papier-Tabelle als PDF gescannt, im Wesentlichen ein Bild. Erfordert OCR zur Texterkennung und zudem Erkennung der Tabellenlinienstruktur. Schwierig.
Tabelle ohne Rahmen
Die Tabelle im PDF hat keine sichtbaren Ränder, die Anordnung erfolgt durch Ausrichtung. Erkennung schwierig, da keine Linien als Referenz.
Tabellenstrukturerkennung
Erkennungsablauf
- Tabellenbereich erkennen: die Position der Tabelle im PDF finden
- Linien erkennen: horizontale und vertikale Linien bestimmen die Zeilen-/Spaltenstruktur
- Zellen lokalisieren: Linienkreuzungen bestimmen die Zellen
- Text extrahieren: der Text in jeder Zelle
- Tabelle rekonstruieren: Excel-Tabelle nach Zeilen und Spalten erzeugen
Schwierigkeiten
- Verbundene Zellen: Zellen über mehrere Spalten oder Zeilen
- Verschachtelte Tabellen: Tabelle in einer Tabelle
- Seitenübergreifende Tabellen: eine Tabelle auf zwei Seiten
- Leere Zellen: Zellen ohne Text
- Schiefe Tabellen: schief gescannt
Textbasiertes PDF zu Excel
Methode
Ein textbasiertes PDF hat eine Textebene, direkte Extraktion:
- Text und Positionen des PDF lesen
- Tabellenlinien erkennen
- Text nach Position den Zellen zuordnen
- Excel erzeugen
Wiederherstellungsgrad
- Regelmäßige Tabellen (gerade Linien, keine Verbunde): hoher Wiederherstellungsgrad
- Komplexe Tabellen (verbundene Zellen, Verschachtelung): mittlerer Wiederherstellungsgrad
- Tabellen ohne Rahmen: niedriger Wiederherstellungsgrad
Gescanntes PDF zu Excel
OCR + Tabellenerkennung erforderlich
Ein gescanntes PDF hat keine Textebene:
- OCR erkennt den Text
- Tabellenlinienstruktur erkennen
- Den erkannten Text nach Tabellenstruktur anordnen
- Excel erzeugen
Schwieriger als textbasiert, die Genauigkeit wird stark von Scanqualität und OCR beeinflusst.
Konvertierungsschritte
1. Typ bestimmen
Versuchen, den Text in der Tabelle zu markieren. Wenn möglich, ist es textbasiert; wenn nicht, gescannt.
2. Konvertieren
Mit dem PDF-zu-Excel-Werkzeug:
- PDF hochladen
- Das Werkzeug erkennt die Tabellenstruktur
- Excel-Datei erzeugen
- Herunterladen
3. Daten prüfen
Nach der Konvertierung unbedingt prüfen:
- Sind die Daten vollständig (keine fehlenden Zeilen oder Spalten)
- Sind die Zahlen korrekt (OCR kann 0 mit O verwechseln)
- Ist die Tabellenstruktur richtig (Zeilen/Spalten nicht verschoben)
- Sind verbundene Zellen wiederhergestellt
Tipps zur Verbesserung der Genauigkeit
Qualität des Quell-PDF
- Hohe Schärfe
- Klare Tabellenlinien
- Keine Schieflage und Flecken
Tabellen vereinfachen
- Verbundene Zellen vermeiden (vor der Konvertierung im Quelldokument trennen)
- Verschachtelte Tabellen vermeiden
- Eine Tabelle pro Seite (seitenübergreifende Tabellen sind schwierig)
Seitenweise konvertieren
Jede Seite separat konvertieren, prüfen und dann zusammenführen. Genauer als eine Konvertierung des gesamten PDF auf einmal.
Zahlenprüfung besonders wichtig
OCR verwechselt leicht Zahlen und Buchstaben:
- 0 und O
- 1 und l, I
- 5 und S
- 8 und B
Kritische Zahlen wie Finanzdaten, Personalausweisnummern müssen einzeln geprüft werden.
Mit Excel-Formeln validieren
Nach der Konvertierung die Datenplausibilität mit Excel-Formeln prüfen:
- Stimmen die Summen
- Liegen die Prozentsätze zwischen 0 und 100 %
- Sind die Daten sinnvoll
Häufige Fragen
Tabelle wird zu Fließtext
- Erkennung der Tabellenstruktur fehlgeschlagen
- Lösung: Tabelle in Excel manuell rekonstruieren und Text kopieren
Daten verschoben
- Fehler bei der Zellenzuordnung
- Lösung: manuell anpassen
Zahlenfehler
- OCR-Erkennungsfehler
- Lösung: Zahlen einzeln prüfen
Seitenübergreifende Tabelle verloren
- Eine Tabelle auf zwei Seiten, nur eine Seite erkannt
- Lösung: Daten beider Seiten manuell zusammenführen
Verbundene Zellen getrennt
- Verbundene Zellen wurden in mehrere Zellen getrennt, Daten nur in einer
- Lösung: manuell verbinden oder Daten ergänzen
Leere Zellen verloren
- Leere Zellen nicht erkannt, dadurch Spaltenverschiebung
- Lösung: anhand des Original-PDF leere Zellen ergänzen
Alternative Lösungen
Manuelle Eingabe
Bei kleinen Tabellen (ein bis zwei Seiten) ist die manuelle Eingabe in Excel schneller und genauer als Konvertierung und Prüfung.
Kopieren und Einfügen
Bei textbasiertem PDF kann der Tabellentext markiert, kopiert und in Excel eingefügt werden. Nach dem Einfügen kann „Text in Spalten“ nötig sein.
PDF-Formular-Extraktion
Wenn das PDF ein Formularformat hat, mit einem PDF-Formular-Extraktionswerkzeug direkt die Felddaten extrahieren.
Zusammenfassung
Bei der Konvertierung von PDF zu Excel geht es um Tabellenstrukturerkennung und Textextraktion. Textbasiert ist einfacher als gescannt, regelmäßige Tabellen genauer als komplexe. Nach der Konvertierung müssen die Daten geprüft werden, besonders die Zahlen. Das DocsAll PDF-zu-Excel-Werkzeug läuft im Browser, die Datei bleibt lokal. Bei kleinen Tabellen kann manuelle Eingabe effizienter sein.