Um ein Bild in Text umzuwandeln, ziehen Sie eine JPG-, PNG-, WebP-, BMP- oder GIF-Datei in das Tool „Bild in Text“ von Krawly, wählen die Sprache des Textes (bis zu 3 gleichzeitig) und starten die Texterkennung. Die Tesseract-Engine liest das Bild lokal in Ihrem Browser und liefert bearbeitbaren Text, den Sie kopieren oder als .txt-Datei herunterladen. Nichts wird hochgeladen, keine Anmeldung nötig.
So nutzen Sie das Tool Bild in Text (OCR)
- 1
Bilder hinzufügen
Ziehen Sie JPG-, PNG-, WebP-, BMP- oder GIF-Dateien auf die Ablagefläche oder klicken Sie, um sie auszuwählen. Pro Durchgang sind bis zu 20 Bilder möglich, etwa eine Reihe Screenshots oder abfotografierte Seiten.
- 2
Textsprache wählen
Englisch ist voreingestellt. Wählen Sie die Sprache, in der Ihr Text geschrieben ist – oder bis zu drei Sprachen, wenn das Bild sie mischt, etwa Deutsch und Englisch auf einer zweisprachigen Speisekarte.
- 3
OCR starten
Klicken Sie auf „Text extrahieren“. Beim ersten Mal lädt Ihr Browser die OCR-Engine und das Sprachmodell herunter und speichert sie im Cache. Jedes Bild wird auf Ihrem Gerät verarbeitet und erhält ein eigenes Textfeld mit einer durchschnittlichen Konfidenz.
- 4
Prüfen und korrigieren
Die Ergebnisse sind bearbeitbar. Korrigieren Sie falsch erkannte Zeichen direkt im Textfeld, bevor Sie den Text verwenden; eine niedrige Konfidenz ist ein Hinweis, dass eine Zeile genauer geprüft werden sollte.
- 5
Kopieren oder herunterladen
Mit „Alles kopieren“ landet der Text in der Zwischenablage, mit „.txt herunterladen“ speichern Sie die Ergebnisse. Bei mehreren Bildern fasst der Download alle in einer .txt-Datei mit einer Überschrift pro Bild zusammen.
Wie funktioniert Bild in Text (OCR)?
OCR steht für Optical Character Recognition, auf Deutsch optische Zeichenerkennung: Eine Software betrachtet die Pixel eines Bildes, findet die Bereiche mit Schrift und ermittelt, welche Zeichen dort stehen. Das Ergebnis ist echter Text, den Sie durchsuchen, bearbeiten, in ein Dokument einfügen oder in eine Tabelle übernehmen können – statt eines Bildes von Text, das Sie sonst von Hand abtippen müssten. Genau das meinen die meisten, wenn sie ein Foto in Text umwandeln wollen.
Krawly verwendet Tesseract, eine seit vielen Jahren gepflegte Open-Source-OCR-Engine. Sie wurde ursprünglich bei Hewlett-Packard entwickelt, 2005 als Open Source veröffentlicht und später mit Unterstützung von Google weiterentwickelt. Hier läuft sie als Tesseract.js, eine nach WebAssembly kompilierte Version, die ohne Server direkt in einer Webseite ausgeführt werden kann. Vereinfacht gesagt bereitet die Engine das Bild zu dunklem Text auf hellem Grund auf, zerlegt die Seite in Blöcke, Zeilen und Wörter und erkennt dann jede Zeile mit einem trainierten Modell für die gewählte Sprache.
Genau deshalb ist die Sprachwahl wichtig. Jede Sprache hat ihr eigenes Modell mit eigenem Alphabet, eigenen Sonderzeichen und typischen Wortformen. Wenn Sie die Engine Englisch lesen lassen, das Bild aber auf Deutsch, Polnisch oder Vietnamesisch ist, versucht sie es trotzdem – doch Umlaute, ß und andere diakritische Zeichen werden dann falsch erkannt. Die richtige Sprache oder eine Kombination aus bis zu drei Sprachen zu wählen, ist einer der einfachsten Wege zu saubereren Ergebnissen.
So erkennen Sie Text aus Bild, Foto oder Screenshot genauer
OCR funktioniert am besten bei klarem, gedrucktem Text mit gutem Kontrast und geraden Zeilen. Screenshots sind meist ideal, weil der Text scharf und perfekt waagerecht ist. Bei Scans sind etwa 300 DPI ein gutes Ziel: hoch genug, damit kleine Buchstaben saubere Kanten haben, ohne riesige Dateien zu erzeugen. Wenn Sie eine Seite mit dem Handy fotografieren, füllen Sie das Bild mit dem Dokument, halten Sie die Kamera parallel zum Papier und vermeiden Sie Schatten von Hand oder Handy.
Kontrast ist wichtiger als Farbe. Schwarzer Text auf weißem Papier ist einfach; hellgrauer Text auf beigem Grund oder weißer Text über einem unruhigen Foto ist deutlich schwieriger. Wenn das Ergebnis schlecht aussieht, schneiden Sie das Bild auf den Textbereich zu, drehen Sie es, bis die Zeilen gerade liegen, und erhöhen Sie in einem beliebigen Bildprogramm den Kontrast, bevor Sie die OCR erneut starten. Schiefe, gewölbte oder perspektivisch verzerrte Zeilen – etwa auf einer Seite, die nahe am Buchrücken fotografiert wurde – sind eine häufige Ursache für fehlende Wörter.
Sehr kleiner Text ist ein weiteres typisches Problem. Wenn Buchstaben nur wenige Pixel hoch sind, reichen die Details nicht, um ein e von einem c oder ein l von einer 1 zu unterscheiden. Vor dem Screenshot hineinzuzoomen oder mit höherer Auflösung zu scannen, hilft meist mehr als jede spätere Bearbeitung. Bedenken Sie: Ein bereits kleines Bild zu vergrößern, kann keine Details hinzufügen, die nie aufgenommen wurden.
Was OCR nicht kann: Handschrift, Tabellen und Layout
Tesseract ist für gedruckten Text gebaut. Handschrift, Schreibschrift, Unterschriften und stark stilisierte oder dekorative Schriften liefern meist schlechte oder unbrauchbare Ergebnisse. Dasselbe gilt für niedrig aufgelöste, unscharfe oder stark komprimierte Fotos. Fällt Ihr Bild in eine dieser Gruppen, müssen Sie mit vielen Korrekturen von Hand rechnen – oder den Text gleich abtippen.
Die Ausgabe ist reiner Text. Spalten, Tabellen, Fett- und Kursivschrift, Schriftgrößen und Bilder bleiben nicht erhalten. Ein zweispaltiger Artikel wird zu fortlaufenden Textzeilen, eine Tabelle zu Zeilen aus Wörtern, die durch Leerzeichen getrennt sind – die Struktur müssen Sie nach dem Einfügen eventuell nacharbeiten. Dieses Tool erzeugt keine Word-Dokumente und keine Tabellen.
Jedes Bild erhält außerdem eine durchschnittliche Konfidenz in Prozent. Sie ist die eigene Einschätzung der Engine, wie sicher sie sich bei den erkannten Wörtern war, keine Garantie für Genauigkeit – aber ein nützliches Signal: Ein deutlich niedrigerer Wert bedeutet meist, dass das Bild schärfer, gerader oder enger zugeschnitten sein sollte.
Ist OCR bei Screenshots, Ausweisen und Belegen sicher?
OCR wird oft auf sensible Inhalte angewendet: Quittungen für die Spesenabrechnung, Screenshots von Chats oder Banking-Apps, Rechnungen, Verträge, Ausweise und Briefe. Viele Online-OCR-Dienste laden diese Bilder zur Verarbeitung auf einen Server hoch. Krawly nicht. Die Erkennung läuft vollständig in Ihrem Browser mit JavaScript und WebAssembly, und Ihre Bilder werden nie an die Server von Krawly gesendet.
Ihr Browser lädt nur Programmdateien herunter: die Tesseract-Engine und das Sprachmodell für jede gewählte Sprache, jeweils einige Megabyte. Nach dem ersten Durchgang liegen sie im Cache, sodass weitere Durchgänge schneller starten. Bild und erkannter Text bleiben im Arbeitsspeicher der Seite, nichts wird gespeichert, und das Schließen des Tabs verwirft alles.
Weil die Arbeit auf Ihrem Gerät passiert, hängt die Geschwindigkeit von Ihrer Hardware ab. Ein aktueller Laptop erledigt einen Screenshot schnell; ein älteres Handy braucht für große Fotos länger. Das Tool funktioniert in aktuellen Versionen von Chrome, Edge, Firefox und Safari auf Desktop und Mobilgeräten – kostenlos, ohne Anmeldung, ohne E-Mail und ohne Tageslimit.
Tipps für beste Ergebnisse
- Schneiden Sie das Bild vor der OCR auf den benötigten Text zu. Ohne Logos, Fotos und Seitenränder hat die Engine weniger, das sie falsch lesen kann.
- Wählen Sie jede Sprache, die im Bild vorkommt, bis zu drei. Ein deutsches Dokument mit englischen Zitaten wird mit beiden Sprachen besser erkannt.
- Text aus Screenshot kopieren? Vergrößern Sie die Seite vor der Aufnahme, damit die Buchstaben größer und schärfer sind.
- Zeilen mit ungewöhnlichen Zeichen, Zahlen und Satzzeichen prüfen: 0 und O, 1 und l sowie rn und m sind klassische OCR-Verwechslungen.
- Ein iPhone-Foto im HEIC-Format? Wandeln Sie es zuerst mit dem Tool HEIC in JPG um und starten Sie die OCR dann mit dem JPG.
- Für ein eingescanntes PDF nutzen Sie besser PDF in Text, statt jede Seite per Screenshot aufzunehmen. Das Tool liest vorhandenen eingebetteten Text und setzt OCR nur dort ein, wo sie nötig ist.
Häufige Fragen
Kann das Tool Handschrift erkennen?
Nicht zuverlässig. Die Tesseract-Engine ist für gedruckten Text ausgelegt, deshalb kommen handschriftliche Notizen, Schreibschrift und Unterschriften meist als bruchstückhafte oder falsche Zeichen heraus. Sehr saubere Druckbuchstaben funktionieren manchmal teilweise. Bei Handschrift ist Abtippen oft schneller, als die OCR-Ausgabe zu korrigieren.
Welche Sprachen werden unterstützt?
Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Niederländisch, Türkisch, Polnisch, Russisch, Ukrainisch, Arabisch, Hindi, Japanisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Koreanisch, Vietnamesisch und Indonesisch. Für Bilder mit gemischten Sprachen können Sie bis zu drei Sprachen gleichzeitig auswählen.
Werden meine Bilder auf einen Server hochgeladen?
Nein. Die OCR läuft in Ihrem Browser mit Tesseract, kompiliert nach WebAssembly. Ihr Browser lädt die Engine und die Sprachdateien herunter, aber Ihre Bilder und der erkannte Text verlassen Ihr Gerät nie. Nichts wird gespeichert, und das Schließen des Tabs löscht alles.
Warum ist der erste Durchgang langsamer?
Bei der ersten Nutzung lädt Ihr Browser die OCR-Engine und das Modell für jede gewählte Sprache herunter, einige Megabyte pro Sprache. Diese Dateien werden im Cache gespeichert, sodass spätere Durchgänge mit denselben Sprachen deutlich schneller starten. Eine neu gewählte Sprache löst einmalig den Download ihres Modells aus.
Wie viele Bilder kann ich auf einmal umwandeln?
Bis zu 20 Bilder pro Durchgang, jeweils bis zu 50 MB. Jedes Bild erhält ein eigenes bearbeitbares Textfeld, und „.txt herunterladen“ fasst alle Ergebnisse in einer Textdatei mit einer Überschrift pro Bild zusammen. Es gibt kein Tageslimit, Sie können also sofort den nächsten Durchgang starten.
Welche Bildformate kann ich verwenden?
JPG, PNG, WebP, BMP und GIF, jeweils bis zu 50 MB. Als PNG gespeicherte Screenshots sind meist die sauberste Vorlage, weil der Text scharf ist. HEIC-Fotos vom iPhone werden nicht direkt akzeptiert; wandeln Sie sie zuerst mit dem Tool HEIC in JPG um und starten Sie dann die OCR mit dem JPG.
Bleiben Tabellen und Formatierung erhalten?
Nein. Die Ausgabe ist reiner Text. Spalten werden zusammengeführt, Tabellen werden zu Wortzeilen mit Leerzeichen dazwischen, und Schriften, Fettdruck und Bilder entfallen. Sie können den Text vor dem Kopieren im Ergebnisfeld bearbeiten oder in Ihrem eigenen Editor nacharbeiten.
Was bedeutet die Konfidenz in Prozent?
Sie ist die durchschnittliche Sicherheit der Engine über alle Wörter, die sie in diesem Bild erkannt hat. Sie ist kein gemessener Genauigkeitswert, aber ein niedriger Wert ist ein guter Hinweis darauf, dass das Bild unscharf, schief oder kontrastarm ist oder in einer anderen als der gewählten Sprache vorliegt.
Privat durch Bauweise. Jeder Krawly-Konverter läuft in Ihrem Browser mit JavaScript und WebAssembly. Ihre Dateien werden weder hochgeladen noch gespeichert noch von jemandem gesehen – wenn Sie den Tab schließen, sind sie weg.