Comment extraire le texte d’un PDF

Comment extraire le texte d’un PDF

Retaper un passage d’un PDF est une perte de temps quand les mots sont déjà dans le fichier. Extraire le texte les sort en texte brut que vous pouvez copier, traduire ou coller ailleurs.

Comment fonctionne l’extraction de texte

La plupart des PDF ont une couche de texte : les vrais caractères qui rendent le document sélectionnable et consultable par recherche. L’extraction lit directement cette couche, dans votre navigateur.

Quand l’OCR est nécessaire d’abord

Un scan n’est qu’une image de la page, sans couche de texte : il n’y a donc rien à extraire. Passez-le d’abord par Rendre recherchable : l’outil lit le texte de l’image et l’ajoute au fichier. Ensuite, extrayez le texte.

Comment extraire le texte d’un PDF

  1. Ouvrez Extraire le texte et déposez votre PDF.
  2. Cliquez sur Extraire le texte.
  3. Copiez tout, ou téléchargez-le en fichier .txt.

Et la mise en forme ?

Vous obtenez du texte brut : les colonnes, les tableaux et les styles de police ne sont pas conservés, et les sauts de page deviennent des lignes vides. Pour garder la mise en page, convertissez le PDF en Word.

Faites-le maintenant : Extraire le texte

Tous les guides