OCR Gratuit · sans inscription · sans filigrane

Convertir un PDF en texte avec OCR

Extrayez le texte de n'importe quel PDF, y compris des documents numérisés. Krawly lit la couche de texte intégrée quand elle existe et lance l'OCR sur les pages qui ne sont que des images, le tout dans votre navigateur.

Updated Krawly Editorial TeamIn-house engineers, writers & reviewers

ou déposez un fichier ici

PDF · jusqu'à 200 MB

Traité dans votre navigateur — aucun fichier n'est envoyé

Réponse rapide

Pour convertir un PDF en texte, déposez le fichier dans l'outil PDF en texte de Krawly et choisissez la langue du document (jusqu'à 3). Les pages contenant déjà du texte sont extraites instantanément ; les pages numérisées sont rendues à 300 DPI et lues par l'OCR Tesseract. Vous obtenez du texte brut avec des séparateurs de pages, à copier ou télécharger en .txt. Le PDF reste sur votre appareil.

Comment utiliser l'outil PDF en texte (OCR)

  1. 1

    Ouvrez votre PDF

    Glissez un PDF dans la zone de dépôt ou cliquez pour en choisir un. Si le fichier est protégé par un mot de passe, l'outil vous le demande ; il ne sert qu'à ouvrir le document dans votre navigateur.

  2. 2

    Sélectionnez la langue du document

    L'anglais est sélectionné par défaut. Choisissez la langue du texte numérisé, ou jusqu'à trois langues pour les documents qui les mélangent. Ce choix ne concerne que les pages qui passent par l'OCR.

  3. 3

    Décidez s'il faut forcer l'OCR

    Laissez « Forcer l'OCR sur chaque page » désactivé pour un usage normal. Activez-le si une extraction précédente a donné des caractères illisibles : chaque page est alors rendue et lue par l'OCR au lieu de se fier au texte intégré.

  4. 4

    Extrayez le texte

    Cliquez sur « Extraire le texte ». Les pages avec couche de texte sont traitées presque immédiatement ; les pages qui ne sont que des images prennent plus de temps, car elles sont rendues et reconnues sur votre appareil. Le résultat indique quelles pages sont passées par l'OCR.

  5. 5

    Copiez ou téléchargez le .txt

    Le texte s'affiche avec un séparateur --- Page N --- avant chaque page. Copiez-le dans le presse-papiers ou téléchargez-le en fichier .txt.

PDF natif ou PDF numérisé : pourquoi la couche de texte est vérifiée d'abord

Tous les PDF ne stockent pas le texte de la même façon. Un PDF exporté depuis un traitement de texte, un navigateur ou un logiciel de comptabilité contient généralement une couche de texte : les caractères eux-mêmes, leurs polices et leur position sur la page. Un PDF numérisé, ou créé à partir de photos prises au téléphone, est différent. Chaque page n'est qu'une image : il n'y a aucun caractère à copier, et essayer de copier le texte d'un PDF de ce type dans une visionneuse ne donne rien.

Krawly gère les deux en un seul passage. Pour chaque page, il utilise d'abord PDF.js, la bibliothèque PDF de Mozilla, pour chercher une couche de texte intégrée. Si la page en a une, le texte est extrait directement. C'est exact, puisque l'outil lit les caractères que le document contient déjà, et c'est quasi instantané. Seules les pages sans couche de texte sont rendues en image à 300 DPI et transmises au moteur OCR Tesseract dans la langue choisie.

C'est important pour les documents mixtes, plus courants qu'on ne le pense : un contrat avec une page de signature numérisée, un rapport avec des annexes photocopiées, ou un formulaire imprimé, rempli puis renumérisé. Lire la couche de texte quand elle existe évite d'introduire des erreurs d'OCR dans des pages déjà parfaites, et fait gagner du temps sur les longs documents. Le résultat vous indique quelles pages sont passées par l'OCR, pour savoir où relire.

Quand forcer l'OCR face à un texte PDF illisible

Il arrive qu'un PDF ait une couche de texte, mais que le texte obtenu soit incohérent : symboles aléatoires, lettres dans le désordre, espaces manquantes, ou carrés à la place des caractères accentués. Cela vient généralement de la manière dont le PDF a été produit. Certains générateurs intègrent des polices sans correspondance correcte entre les glyphes et les caractères, et certains logiciels de numérisation ajoutent par-dessus l'image de la page une couche OCR invisible de mauvaise qualité.

Dans ces cas, activez « Forcer l'OCR sur chaque page ». L'outil ignore alors le texte intégré, rend chaque page à 300 DPI et lit ce qui y est visiblement imprimé. Vous échangez de la vitesse contre de la fiabilité : l'OCR de chaque page prend nettement plus de temps que la lecture d'une couche de texte, surtout sur téléphone, mais le résultat reflète ce que vous voyez réellement à l'écran.

Forcer l'OCR n'est pas nécessaire pour les PDF natifs ordinaires. Si le texte extrait est propre, la couche de texte est la source la plus exacte, car elle contient les caractères exacts plutôt qu'une interprétation de pixels.

Extraire le texte de documents multilingues ou en alphabets non latins

L'OCR lit les pages numérisées à l'aide d'un modèle de langue : le réglage de langue est donc important pour toute page qui passe par l'OCR. Krawly prend en charge l'anglais, l'espagnol, le portugais, le français, l'allemand, l'italien, le néerlandais, le turc, le polonais, le russe, l'ukrainien, l'arabe, le hindi, le japonais, le chinois (simplifié et traditionnel), le coréen, le vietnamien et l'indonésien, et vous pouvez en combiner jusqu'à trois. Un contrat en français avec une annexe en anglais, ou un document ukrainien avec des citations en russe, doit avoir les deux langues sélectionnées.

Les pages qui ont déjà une couche de texte ne dépendent pas du choix de la langue, car leurs caractères sont lus directement. Autrement dit, un PDF natif dans n'importe quelle écriture, pas seulement dans les langues de la liste, peut quand même être extrait, à condition que le PDF stocke correctement son texte.

Chaque modèle de langue est téléchargé la première fois que vous le sélectionnez, quelques mégaoctets par langue, puis mis en cache par votre navigateur. Ne sélectionner que les langues réellement présentes dans le document raccourcit le premier lancement.

Extraction de texte PDF confidentielle, sans envoi

Les PDF dont on veut extraire le texte sont souvent les plus sensibles : relevés bancaires, fiches de paie, courriers médicaux, contrats signés, formulaires fiscaux et passeports numérisés. Avec cet OCR PDF, tout le traitement se fait dans votre navigateur grâce à PDF.js et Tesseract.js compilés en WebAssembly. Le PDF n'est jamais envoyé aux serveurs de Krawly, pas plus que le texte extrait.

Votre navigateur ne télécharge que des fichiers programme, à savoir le moteur OCR et les modèles de langue. Si le PDF est protégé par un mot de passe, celui-ci est saisi et utilisé localement pour ouvrir le fichier. Rien n'est conservé, et fermer l'onglet efface le document et les résultats.

La contrepartie du traitement local, c'est que la vitesse dépend de votre appareil. Les pages avec couche de texte sont rapides partout, tandis que l'OCR de nombreuses pages numérisées peut prendre un moment sur un téléphone ancien. Les PDF jusqu'à 200 Mo sont pris en charge, et l'outil fonctionne dans les versions récentes de Chrome, Edge, Firefox et Safari, sur ordinateur comme sur mobile. Il est gratuit, sans inscription et sans limite quotidienne.

Conseils pour de meilleurs résultats

  • Essayez d'abord une extraction normale. N'activez « Forcer l'OCR » que si le texte sort illisible, car l'OCR de chaque page est beaucoup plus lent.
  • Relisez les pages signalées comme passées par l'OCR. Ce sont elles qui peuvent contenir des caractères mal lus ; les pages avec couche de texte sont exactes.
  • Pour un long scan dont vous n'avez besoin que de quelques pages, extrayez-les d'abord avec Diviser PDF, puis lancez PDF en texte sur le fichier plus court.
  • Sélectionnez toutes les langues des pages numérisées, jusqu'à trois, mais pas plus que nécessaire, pour télécharger moins de modèles.
  • Les PDF numérisés avec des pages de travers ou très pâles donnent un OCR moins bon. Si possible, renumérisez à environ 300 DPI avec la page bien à plat.
  • Les séparateurs --- Page N --- permettent de retrouver facilement le début de chaque page quand vous collez le texte dans un autre document.

Questions fréquentes

Peut-on convertir un PDF scanné en texte ?

Oui. Les pages sans couche de texte, comme les scans ou les pages photographiées, sont rendues à 300 DPI et lues par le moteur OCR Tesseract dans la langue choisie. Les pages qui contiennent déjà du texte sont extraites directement. Le résultat indique quelles pages sont passées par l'OCR.

Y a-t-il une limite de pages ?

Il n'y a pas de nombre de pages fixe. Les PDF jusqu'à 200 Mo sont pris en charge. En pratique, la limite est le temps : les pages avec couche de texte sont quasi instantanées, tandis que chaque page numérisée nécessite un OCR sur votre propre appareil ; un long document numérisé peut donc prendre un moment, surtout sur téléphone.

Pourquoi le texte extrait est-il illisible ?

Certains PDF contiennent une couche de texte défectueuse, souvent parce que les polices ont été intégrées sans correspondance correcte des caractères, ou parce qu'une couche OCR de mauvaise qualité a été ajoutée lors de la numérisation. Activez « Forcer l'OCR sur chaque page » et relancez la conversion ; l'outil lira alors ce qui est visiblement imprimé.

Quelles langues sont prises en charge pour l'OCR ?

Anglais, espagnol, portugais, français, allemand, italien, néerlandais, turc, polonais, russe, ukrainien, arabe, hindi, japonais, chinois (simplifié), chinois (traditionnel), coréen, vietnamien et indonésien, avec jusqu'à trois langues sélectionnées à la fois. Les pages avec couche de texte intégrée sont extraites directement, quelle que soit leur langue.

Mon PDF est-il envoyé quelque part ?

Non. L'extraction de texte et l'OCR se font toutes deux dans votre navigateur. Seuls les fichiers du moteur OCR et des modèles de langue sont téléchargés ; le PDF, son éventuel mot de passe et le texte extrait restent sur votre appareil. Rien n'est conservé, et fermer l'onglet efface tout.

Pourquoi le premier OCR est-il plus lent ?

Lors de la première utilisation, votre navigateur télécharge le moteur Tesseract et le modèle de chaque langue sélectionnée, quelques mégaoctets par langue, puis les met en cache. Les lancements suivants réutilisent ce cache et démarrent plus vite.

La mise en page, les tableaux ou les images sont-ils conservés ?

Non. Le résultat est du texte brut avec un séparateur --- Page N --- pour chaque page. Les polices, colonnes, tableaux et images ne sont pas conservés, et l'outil ne crée pas de fichiers Word ou Excel. Les colonnes et les tableaux sont mis à plat en lignes de texte qu'il faudra peut-être remettre en ordre.

Peut-on extraire le texte d'un PDF protégé par mot de passe ?

Oui, si vous connaissez le mot de passe. L'outil le demande à l'ouverture du fichier et ne l'utilise que dans votre navigateur pour déchiffrer le document. Le mot de passe n'est ni envoyé à Krawly ni enregistré nulle part.

Confidentiel par conception. Chaque convertisseur Krawly tourne dans votre navigateur grâce à JavaScript et WebAssembly. Vos fichiers ne sont ni envoyés, ni stockés, ni vus par personne : quand vous fermez l'onglet, ils disparaissent.

Convertisseurs associés

Voir les 21 convertisseurs gratuits