Site icon Tech-Connect

PDF scanné illisible ? OCRmyPDF le rend cherchable, gratuitement

PDF scanné illisible ? OCRmyPDF le rend cherchable, gratuitement

OCRmyPDF : l’outil open source qui rend vos vieux PDF scannés enfin consultables

Il y a quelques semaines, je me suis retrouvé face à une pile numérique de plusieurs centaines de pages : des archives familiales scannées à la va-vite, des années plus tôt, sur un vieux multifonction HP. Résultat, des fichiers PDF composés uniquement d’images, impossible de faire un Ctrl+F, impossible de copier une ligne, impossible même de savoir si le document que je cherchais se trouvait dans le tas sans tout rouvrir un par un. J’ai d’abord tenté plusieurs logiciels gratuits mais sa reconnaissance de caractères s’est révélée trop capricieuse dès qu’on sortait de l’anglais. C’est finalement un petit programme en ligne de commande, méconnu du grand public mais culte chez les linuxiens, qui m’a sauvé la mise : OCRmyPDF.

Le vrai problème des PDF scannés (et pourquoi Ctrl+F ne sert à rien)

Un PDF « scanné » n’est, la plupart du temps, qu’une photographie déguisée en document. Le scanner capture une image de la page, l’enrobe dans une enveloppe PDF, et voilà : visuellement, on dirait un vrai document texte, mais l’ordinateur ne voit qu’un dessin. Aucune donnée textuelle n’existe derrière les pixels, donc aucune recherche, aucun copier-coller, et l’indexation par les moteurs de recherche ou par votre propre gestionnaire de fichiers reste totalement aveugle.

💡 Définition express

L’OCR (Optical Character Recognition, ou reconnaissance optique de caractères) est la technologie qui analyse la forme des lettres sur une image pour en déduire le texte réel. C’est ce même principe qui permet à votre smartphone de scanner une carte de visite et d’en extraire automatiquement le numéro de téléphone.

OCRmyPDF, en clair : Tesseract mis au service de vos PDF

OCRmyPDF est un logiciel libre qui ajoute une couche de texte invisible, mais parfaitement consultable, par-dessus l’image scannée d’un PDF. Une fois le traitement terminé, la page garde exactement la même apparence, mais vous pouvez désormais sélectionner, copier ou rechercher n’importe quel mot du document.

Concrètement, l’outil ne réinvente pas la roue : il s’appuie sur Tesseract, le moteur de reconnaissance de caractères développé à l’origine par HP puis repris et maintenu par Google en open source. Le déroulé est le suivant :

Ce dernier point est loin d’être un détail : Tesseract seul gère assez mal les documents multipages et la génération de PDF/A. OCRmyPDF comble précisément ces lacunes, tout en répartissant le travail sur tous les cœurs du processeur pour accélérer les traitements par lots.

Le projet est maintenu par le développeur James R. Barlow, distribué sous licence libre MPL-2.0, et rassemble aujourd’hui plus de 34 000 étoiles sur GitHub, un signe de confiance rare pour un outil purement destiné à la ligne de commande.

⚠️ À savoir avant de se lancer

OCRmyPDF n’a pas d’interface graphique officielle : tout se pilote au clavier, via des commandes. Si l’idée du terminal vous rebute, des alternatives comme NAPS2 (gratuite, open source, glisser-déposer) reprennent le même moteur Tesseract dans une interface plus accessible, nous en reparlons plus bas.

Installer OCRmyPDF sous Windows 10 et 11 grâce à WSL

OCRmyPDF tourne nativement sous Linux et macOS. Sous Windows, trois chemins s’offrent à vous : Docker, pip, ou le sous-système Windows pour Linux (WSL). C’est cette dernière option que je recommande si vous n’avez encore jamais touché à un terminal Linux, car elle s’intègre directement à votre système existant.

Étape par étape

  1. Ouvrez une invite PowerShell en administrateur et installez WSL si ce n’est pas déjà fait, avec la commande « wsl –install », puis redémarrez votre PC.
  2. Lancez votre terminal Ubuntu (WSL) et mettez à jour la liste des paquets : « sudo apt-get update ».
  3. Installez OCRmyPDF en une ligne : « sudo apt-get install ocrmypdf ». Le paquet embarque automatiquement Tesseract et Ghostscript, aucune installation séparée n’est nécessaire.
  4. Vérifiez l’installation avec « ocrmypdf –version ».
  5. Placez-vous dans le dossier contenant votre PDF (vos disques Windows sont accessibles via /mnt/c/, /mnt/d/, etc.) et lancez : « ocrmypdf input.pdf output.pdf ».

Pour un scan légèrement de travers ou un peu sale, ajoutez les options de nettoyage :

ocrmypdf –deskew –clean –rotate-pages input.pdf output.pdf

Si le PDF contient déjà une couche de texte, OCRmyPDF l’ignore par défaut pour ne pas retraiter inutilement le fichier ; l’option –force-ocr permet de forcer un nouveau passage si besoin.

🔎 Nuan ce à connaître

Rien ne vous oblige à passer par WSL : si vous utilisez déjà Docker au quotidien, l’image officielle jbarlow83/ocrmypdf fonctionne tout aussi bien et évite d’installer quoi que ce soit sur votre système hôte.

Ajouter le français (et d’autres langues) à la reconnaissance

Par défaut, OCRmyPDF traite les documents en anglais. Comme il délègue toute la reconnaissance à Tesseract, la prise en charge des langues dépend simplement des modules linguistiques installés, Tesseract couvre plus de cent langues et systèmes d’écriture, du français à l’arabe en passant par le chinois.

Cette dernière astuce est particulièrement utile sur des archives anciennes truffées de tampons, cachets ou mentions dans une langue différente du corps du texte : le mode combiné ne ralentit pratiquement pas le traitement.

OCRmyPDF face à la concurrence : quel outil pour quel profil ?

OCRmyPDF n’est pas la seule option pour rendre un PDF consultable. Le bon choix dépend surtout de votre niveau technique, de votre budget et de votre sensibilité à la confidentialité des données.

OutilPrixInterfaceTraitementIdéal pour
OCRmyPDFGratuit, open sourceLigne de commande100 % localAutomatisation, gros volumes
NAPS2Gratuit, open sourceGlisser-déposer100 % localDébutants sous Windows
Adobe Acrobat ProEnviron 20 €/moisGraphique complèteCloud + localPros déjà équipés Adobe
ABBYY FineReader PDFLicence payanteGraphique complèteLocalDocuments complexes, tableaux

À noter : dans les tests comparatifs récents, NAPS2 obtient une précision comparable à OCRmyPDF sur un même document, ce qui confirme logiquement que les deux s’appuient sur le même moteur Tesseract en coulisses. Adobe et ABBYY gardent l’avantage sur les documents très structurés (tableaux, mise en page complexe), grâce à des moteurs de reconnaissance propriétaires plus sophistiqués.

🟡 Le vrai atout qu’on oublie trop souvent

Contrairement à de nombreux services « OCR en ligne » gratuits, OCRmyPDF ne fait transiter aucun de vos documents sur un serveur distant. Tout le traitement se fait sur votre machine. Pour des archives familiales, des contrats ou des documents administratifs sensibles, ce n’est pas un détail : c’est souvent LA raison de choisir cet outil plutôt qu’un service en ligne.

Mon avis sur OCRmyPDF

Après plusieurs centaines de pages passées à la moulinette, mon jugement est sans appel : la courbe d’apprentissage du terminal se paie en quelques minutes de friction, mais elle s’efface vite devant le gain de temps réel. Aucune application « glisser-déposer » ne m’aurait permis de traiter un dossier entier d’un coup, de choisir précisément mes langues, ni de garantir que mes documents ne quittent jamais mon ordinateur. Pour un usage ponctuel et occasionnel, NAPS2 reste sans doute plus accessible. Mais pour quiconque numérise régulièrement des archives, gère un serveur personnel ou un NAS, ou souhaite automatiser un flux de traitement documentaire, OCRmyPDF est difficile à égaler, gratuitement qui plus est.

Pour traiter un dossier d’un coup, il faudra d’abord installer Parallel « sudo apt install parallel -y », ensuite vous vous déplacez dans le dossier. Il faudra créer un dossier dans lequel il va enregistrer les documents traités, on va donner le nom sortie. Enfin, on lance cette commande qui va récupérer tous les documents pdf, les traiter et les documents traités dans le dossier « sortie » : parallel –tag -j 2 ocrmypdf ‘{}’ ‘sortie/{}’ ::: *.pdf

Quitter la version mobile