Um ein PDF in Text umzuwandeln, ziehen Sie die Datei in das Tool „PDF in Text“ von Krawly und wählen die Sprache des Dokuments (bis zu 3). Seiten, die bereits Text enthalten, werden sofort ausgelesen; gescannte Seiten werden mit 300 DPI gerendert und mit Tesseract-OCR gelesen. Sie erhalten reinen Text mit Seitentrennern, bereit zum Kopieren oder als .txt-Download. Das PDF verlässt Ihr Gerät nie.
So nutzen Sie das Tool PDF in Text (OCR)
- 1
PDF öffnen
Ziehen Sie ein PDF auf die Ablagefläche oder klicken Sie, um eines auszuwählen. Ist die Datei passwortgeschützt, fragt das Tool nach dem Passwort; es wird nur in Ihrem Browser zum Öffnen des Dokuments verwendet.
- 2
Dokumentsprache wählen
Englisch ist voreingestellt. Wählen Sie die Sprache des gescannten Textes oder bis zu drei Sprachen für gemischte Dokumente. Die Auswahl wirkt sich nur auf Seiten aus, die OCR brauchen.
- 3
Über erzwungene OCR entscheiden
Lassen Sie „OCR auf jeder Seite erzwingen“ im Normalfall aus. Schalten Sie es ein, wenn eine frühere Extraktion unleserliche Zeichen geliefert hat – dann wird jede Seite gerendert und per OCR gelesen, statt dem eingebetteten Text zu vertrauen.
- 4
Text extrahieren
Klicken Sie auf „Text extrahieren“. Seiten mit Textebene sind fast sofort fertig; reine Bildseiten dauern länger, weil sie auf Ihrem Gerät gerendert und erkannt werden. Das Ergebnis markiert, welche Seiten per OCR gelesen wurden.
- 5
Kopieren oder .txt herunterladen
Der Text erscheint mit einem Trenner --- Page N --- vor jeder Seite. Kopieren Sie ihn in die Zwischenablage oder laden Sie ihn als .txt-Datei herunter – so können Sie ein PDF in TXT umwandeln, das jeder Texteditor öffnet.
Digitale vs. gescannte PDFs: warum zuerst die Textebene geprüft wird
Nicht jedes PDF speichert Text auf dieselbe Weise. Ein PDF, das aus einer Textverarbeitung, einem Browser oder einer Buchhaltungssoftware exportiert wurde, enthält meist eine Textebene: die eigentlichen Zeichen, ihre Schriften und ihre Position auf der Seite. Ein gescanntes PDF oder eines aus Handyfotos ist anders. Jede Seite ist nur ein Bild, es gibt also keine Zeichen zum Kopieren, und das Markieren von Text im PDF-Viewer bewirkt nichts.
Krawly verarbeitet beides in einem Durchgang. Für jede Seite sucht das Tool zuerst mit PDF.js, der PDF-Bibliothek von Mozilla, nach einer eingebetteten Textebene. Hat die Seite eine, wird der Text direkt ausgelesen. Das ist exakt, weil die Zeichen gelesen werden, die das Dokument bereits enthält, und es geht nahezu sofort. Nur Seiten ohne Textebene werden mit 300 DPI zu einem Bild gerendert und in der gewählten Sprache an die Tesseract-OCR-Engine übergeben.
Das zählt bei gemischten Dokumenten, die häufiger sind, als man denkt: ein Vertrag mit eingescannter Unterschriftenseite, ein Bericht mit kopierten Anhängen oder ein Formular, das ausgedruckt, ausgefüllt und wieder eingescannt wurde. Wer die Textebene liest, wo sie existiert, bringt keine OCR-Fehler in Seiten, die bereits perfekt waren, und spart bei langen Dokumenten Zeit. Die Ausgabe zeigt, welche Seiten per OCR gelesen wurden – Sie wissen also, wo Sie Korrektur lesen sollten.
Wann Sie OCR bei unleserlichem PDF-Text erzwingen sollten
Manchmal hat ein PDF eine Textebene, aber der ausgelesene Text ist Unsinn: zufällige Symbole, Buchstaben in falscher Reihenfolge, fehlende Leerzeichen oder Kästchen statt Umlauten. Das liegt meist daran, wie das PDF erzeugt wurde. Manche Programme betten Schriften ohne korrekte Zuordnung von Glyphen zu Zeichen ein, und manche Scan-Software legt eine unsichtbare OCR-Ebene schlechter Qualität über das Seitenbild.
Schalten Sie in diesen Fällen „OCR auf jeder Seite erzwingen“ ein. Das Tool ignoriert dann den eingebetteten Text, rendert jede Seite mit 300 DPI und liest, was sichtbar darauf gedruckt ist. Sie tauschen Geschwindigkeit gegen Zuverlässigkeit: OCR auf jeder Seite dauert spürbar länger als das Lesen einer Textebene, besonders auf dem Handy, aber das Ergebnis entspricht dem, was Sie tatsächlich auf dem Bildschirm sehen.
Bei normalen digitalen PDFs ist erzwungene OCR nicht nötig. Sieht der extrahierte Text sauber aus, ist die Textebene die genauere Quelle, weil sie die exakten Zeichen enthält statt einer Interpretation von Pixeln.
Text aus mehrsprachigen und nicht-lateinischen Dokumenten
Die OCR liest gescannte Seiten mit einem Sprachmodell, deshalb ist die Spracheinstellung für jede Seite wichtig, die OCR braucht. Krawly unterstützt Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Niederländisch, Türkisch, Polnisch, Russisch, Ukrainisch, Arabisch, Hindi, Japanisch, Chinesisch (vereinfacht und traditionell), Koreanisch, Vietnamesisch und Indonesisch, und Sie können bis zu drei davon kombinieren. Bei einem deutschen Vertrag mit englischer Anlage oder einem ukrainischen Dokument mit russischen Zitaten sollten beide Sprachen ausgewählt sein.
Seiten, die bereits eine Textebene haben, sind von der Sprachwahl nicht betroffen, weil ihre Zeichen direkt gelesen werden. Ein digitales PDF in jeder beliebigen Schrift – nicht nur in den Sprachen der Liste – lässt sich also trotzdem auslesen, sofern das PDF seinen Text korrekt speichert.
Jedes Sprachmodell wird bei der ersten Auswahl heruntergeladen, einige Megabyte pro Sprache, und dann von Ihrem Browser im Cache gespeichert. Wenn Sie nur die Sprachen wählen, die tatsächlich im Dokument vorkommen, ist der erste Durchgang kürzer.
Text aus PDF auslesen – privat und ohne Upload
PDFs, aus denen Text gebraucht wird, sind oft die sensiblen: Kontoauszüge, Gehaltsabrechnungen, Arztbriefe, unterschriebene Verträge, Steuerformulare und eingescannte Reisepässe. Bei Krawly läuft der gesamte Vorgang in Ihrem Browser mit PDF.js und Tesseract.js, kompiliert nach WebAssembly. Das PDF wird nie auf die Server von Krawly hochgeladen, und der extrahierte Text ebenso wenig.
Ihr Browser lädt nur Programmdateien herunter, nämlich die OCR-Engine und die Sprachmodelle. Ist das PDF passwortgeschützt, wird das Passwort lokal eingegeben und zum Öffnen der Datei verwendet. Nichts wird gespeichert, und das Schließen des Tabs verwirft Dokument und Ergebnisse.
Der Nachteil der lokalen Verarbeitung: Die Geschwindigkeit hängt von Ihrem Gerät ab. Seiten mit Textebene gehen überall schnell, OCR auf vielen gescannten Seiten kann auf einem älteren Handy eine Weile dauern. PDFs bis 200 MB werden unterstützt, und das Tool funktioniert in aktuellen Versionen von Chrome, Edge, Firefox und Safari auf Desktop und Mobilgeräten. Es ist kostenlos, ohne Anmeldung und ohne Tageslimit.
Tipps für beste Ergebnisse
- Wollen Sie PDF-Text extrahieren, versuchen Sie zuerst eine normale Extraktion. Schalten Sie erzwungene OCR nur ein, wenn der Text unleserlich herauskommt – OCR auf jeder Seite ist viel langsamer.
- Lesen Sie die als OCR markierten Seiten Korrektur. Dort können falsch erkannte Zeichen stecken; Seiten mit Textebene sind exakt.
- Brauchen Sie aus einem langen Scan nur wenige Seiten, extrahieren Sie diese zuerst mit PDF teilen und nutzen Sie PDF in Text dann für die kleinere Datei.
- Wählen Sie alle Sprachen der gescannten Seiten, bis zu drei – aber nicht mehr als nötig, damit weniger Modelle heruntergeladen werden.
- Gescannte PDFs mit schiefen oder sehr blassen Seiten ergeben schwächere OCR. Scannen Sie wenn möglich erneut mit etwa 300 DPI und flach aufliegender Seite.
- Die Trenner --- Page N --- zeigen beim Einfügen in ein anderes Dokument auf einen Blick, wo jede Seite beginnt.
Häufige Fragen
Kann das Tool ein gescanntes PDF in Text umwandeln?
Ja. Seiten ohne Textebene, etwa Scans oder abfotografierte Seiten, werden mit 300 DPI gerendert und mit der Tesseract-OCR-Engine in der gewählten Sprache gelesen. Seiten, die bereits Text enthalten, werden direkt ausgelesen. Das Ergebnis zeigt, welche Seiten per OCR gelesen wurden.
Gibt es eine Seitenbegrenzung?
Es gibt keine feste Seitenzahl. PDFs bis 200 MB werden unterstützt. In der Praxis ist die Grenze die Zeit: Seiten mit Textebene gehen fast sofort, jede gescannte Seite braucht dagegen OCR auf Ihrem eigenen Gerät – ein langes gescanntes Dokument kann also eine Weile dauern, besonders auf dem Handy.
Warum ist der extrahierte Text unleserlich?
Manche PDFs enthalten eine fehlerhafte Textebene, oft weil Schriften ohne korrekte Zeichenzuordnung eingebettet wurden oder weil beim Scannen eine OCR-Ebene schlechter Qualität hinzugefügt wurde. Schalten Sie „OCR auf jeder Seite erzwingen“ ein und starten Sie die Umwandlung erneut; das Tool liest dann, was sichtbar gedruckt ist.
Welche Sprachen werden für die OCR unterstützt?
Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Niederländisch, Türkisch, Polnisch, Russisch, Ukrainisch, Arabisch, Hindi, Japanisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Koreanisch, Vietnamesisch und Indonesisch, davon bis zu drei gleichzeitig. Seiten mit eingebetteter Textebene werden unabhängig von ihrer Sprache direkt ausgelesen.
Wird mein PDF irgendwohin hochgeladen?
Nein. Textextraktion und OCR laufen beide in Ihrem Browser. Heruntergeladen werden nur die Dateien der OCR-Engine und der Sprachmodelle; das PDF, ein eventuelles Passwort und der extrahierte Text bleiben auf Ihrem Gerät. Nichts wird gespeichert, und das Schließen des Tabs löscht alles.
Warum ist der erste OCR-Durchgang langsamer?
Bei der ersten Nutzung lädt Ihr Browser die Tesseract-Engine und das Modell für jede gewählte Sprache herunter, einige Megabyte pro Sprache, und speichert sie im Cache. Spätere Durchgänge nutzen den Cache und starten schneller.
Bleiben Layout, Tabellen oder Bilder erhalten?
Nein. Die Ausgabe ist reiner Text mit einem Trenner --- Page N --- pro Seite. Schriften, Spalten, Tabellen und Bilder bleiben nicht erhalten, und das Tool erstellt keine Word- oder Excel-Dateien. Spalten und Tabellen werden zu Textzeilen zusammengeführt, die Sie eventuell nacharbeiten müssen.
Kann ich Text aus einem passwortgeschützten PDF extrahieren?
Ja, wenn Sie das Passwort kennen. Das Tool fragt beim Öffnen der Datei danach und verwendet es nur in Ihrem Browser, um das Dokument zu entschlüsseln. Das Passwort wird weder an Krawly gesendet noch irgendwo gespeichert.
Privat durch Bauweise. Jeder Krawly-Konverter läuft in Ihrem Browser mit JavaScript und WebAssembly. Ihre Dateien werden weder hochgeladen noch gespeichert noch von jemandem gesehen – wenn Sie den Tab schließen, sind sie weg.