DOKUMENTE, BEREIT ZUM BEARBEITEN

PDF in Word: wann Textextraktion, wann OCR

Wählen Sie einen Lesemodus, prüfen Sie die Quelle und verwandeln Sie PDF-Text in bearbeitbare Absätze, ohne Wörter in Bildern zu übersehen.

ToolMellow ·

Versuchen Sie, einen Satz zu markieren

Ein PDF kann Text, Bilder von Text oder beides enthalten. Vorhandener Text lässt sich oft ohne optische Zeichenerkennung lesen. Eine gescannte Seite braucht in der Regel OCR, um die Buchstaben in ihrem Bild zu erkennen. Das Markieren von Text ist ein nützlicher erster Test, aber eine auswählbare Überschrift beweist nicht, dass der Rest der Seite eine Textebene hat.

Wählen Sie den Lesemodus nach dem Seiteninhalt

Der Modus „Automatisch“ von ToolMellow liest die vorhandene Textebene und verwendet die von Ihnen gewählte OCR-Sprache nur auf Seiten, auf denen er keinen Text findet. Das hilft bei einem Dokument, in dem Seiten mit nativem Text und gescannte Seiten getrennt sind. Wählen Sie für eine Seite, die eine auswählbare Überschrift mit einer gescannten Rechnung kombiniert, „OCR · jede ausgewählte Seite“, damit auch die abgebildeten Wörter berücksichtigt werden. OCR kann Fehler einführen, selbst wenn die Quelle klar aussieht.

Wählen Sie die gedruckte Sprache

Wählen Sie Englisch, vereinfachtes Chinesisch, Hindi, Spanisch, Französisch, Arabisch, Bengalisch, Deutsch, Italienisch oder Portugiesisch, bevor Sie gescannte Seiten lesen. Für den Vorgang gilt eine Sprache. Lesen Sie getrennte Seitenbereiche, wenn ein Dokument die Sprache wechselt; eine Erkennung der Sprache und eine Übersetzung werden nicht angeboten. Nur das gewählte Modell wird heruntergeladen, und zwar wenn OCR benötigt wird. Vorhandener PDF-Text funktioniert ohne jeden OCR-Download. Ein Wechsel der Sprache löscht die vorherige Prüfung und den vorherigen Download, damit sie nicht mit einem neuen Ergebnis verwechselt werden können.

Vergleichen Sie vor dem Exportieren

Die Prüfung zeigt die Quellseite und bearbeitbaren Text oder rekonstruierte Blöcke. Prüfen Sie Namen, Datumsangaben, Beträge, Kontonummern, Satzzeichen, Tabellenzellen und Lesereihenfolge. Die Textextraktion kann Formularwerte auslassen oder eine unerwartete Reihenfolge verwenden. Die OCR-Konfidenz ist eine Schätzung der Engine, keine Garantie, dass eine Zahl stimmt. Korrigieren Sie Ihre gewählte Version, bevor Sie das Word-Dokument erstellen; reiner Text und Struktur behalten getrennte Bearbeitungen.

Wählen Sie einfache Absätze oder geprüfte Struktur

Aktivieren Sie vor dem Lesen „Dokumentstruktur rekonstruieren“, um Absätze, getaggte Überschriften und einfache Listen, ein- oder zweispaltige Bereiche, getaggte oder einfache ausgerichtete Tabellen, grundlegende Formatierung und unterstützte Abbildungsausschnitte zu erkennen. Prüfen Sie Überschriftenebenen, Listenstile, Verschachtelung und Nummern. Benutzerdefinierte Listenzeichen bleiben Text; Listen, die sich über Quellseiten erstrecken, behalten sichtbare Startwerte als getrennte Word-Listen. Bearbeiten Sie Zellen, ordnen Sie Blöcke neu, verschieben Sie sie zwischen Spalten und schneiden Sie fehlende Abbildungen aus der Seite aus. So entsteht nativer, bearbeitbarer Word-Inhalt mit unterstützten Schriftfamiliennamen und einfarbigen Textfarben, einschließlich gemischter Stile in Absätzen und Zellen. Textbearbeitungen behalten die Stile außerhalb der geänderten Passage bei. Prüfen Sie die Steuerungen für Schriftart, Farbe und manuelle Unterstreichung; nicht verfügbare Schriftarten werden ersetzt, weil Schriftarten nicht eingebettet werden. Transparenz, Muster, nicht zuordenbarer Zeichnungstext, exakte Positionierung, Links und interaktive Formulare bleiben nicht erhalten. Die Abmessungen der Quellseite, Letter und A4 stehen zur Verfügung; Text kann dennoch auf weitere Seiten umbrechen. Behalten Sie das PDF, wenn es auf sein exaktes Aussehen ankommt.

Arbeiten Sie in überschaubaren Seitenbereichen

Wählen Sie bis zu 50 Quellseiten, darunter höchstens 10 OCR-Seiten, aus einem PDF mit bis zu 50 MB. Ein Bereich wie 2-4, 7 verringert den Aufwand und hilft Ihnen, sorgfältig zu prüfen. OCR ist für gedrucktes Englisch, vereinfachtes Chinesisch, Hindi, Spanisch, Französisch, Arabisch, Bengalisch, Deutsch, Italienisch oder Portugiesisch gedacht; der Strukturmodus braucht aufrechte Scans, weil er erkannte Wortpositionen verwendet. Unscharfe Scans, Handschrift, komplexe Layouts und Sprachen außerhalb dieser Liste erfordern einen anderen Workflow. Das Tool stoppt Vorgänge, die seine lokalen Render- oder Zeitlimits überschreiten.

Zählen Sie den geprüften Text

„Geprüften Text zählen“ öffnet „Wörter und Zeichen zählen“ mit demselben Inhalt wie „Geprüften Text herunterladen“, in der von Ihnen gewählten Reihenfolge der Quellseiten. Verwendet wird Ihre gewählte Version, reiner Text oder Struktur, einschließlich der Bearbeitungen an Tabellenzellen und Listentext. Abbildungen werden nicht zu Wörtern. Die Übergabe erfolgt einmalig und bleibt im Speicher des Tabs, ohne den Text in eine URL oder den Browserspeicher zu legen. „Wörter und Zeichen zählen“ nimmt bis zu eine Million Zeichen einschließlich Seitentrennern an; längerer Text bleibt als Download verfügbar. „Leeren“ in „Wörter und Zeichen zählen“ verwirft den übergebenen Text und seinen Rückgängig-Verlauf.

Sichern Sie das Ergebnis vor dem Schließen

Ihr PDF, Ihr Passwort, Ihre Prüfbearbeitungen und das Ergebnis bleiben im Speicher des Tabs. Die Erkennungs-Engine und das gewählte Sprachmodell werden bei Bedarf von ToolMellow geladen; das Dokument wird nicht hochgeladen. Laden Sie die DOCX-Datei herunter, bevor Sie die Seite neu laden oder verlassen, öffnen Sie sie dann in Ihrem Textverarbeitungsprogramm und prüfen Sie sie noch einmal.

Setzen Sie es in die Praxis um.