OCR gratuit pour PDF scannés, dans votre navigateur
Transformer un document scanné en texte sélectionnable prend désormais moins de 3 secondes pour 10 Mo, sans envoyer votre fichier sur aucun serveur. iSharePDF intègre un moteur OCR entièrement exécuté dans votre navigateur grâce à WebAssembly : vos contrats, relevés bancaires ou archives numérisées ne quittent jamais votre appareil. Avec 100 Mo de limite par fichier, un chiffrement AES-256 pour les documents Pro et 28 outils PDF disponibles sans installation, c'est la solution d'extraction de texte sur PDF scanné la plus privée du marché en 2026.
Ce que fait l'outil OCR de iSharePDF
L'outil OCR PDF gratuit d'iSharePDF détecte automatiquement les zones de texte dans un fichier image ou un PDF numérisé, puis génère une couche de texte invisible superposée aux pages. Résultat : votre PDF reste visuellement identique, mais vous pouvez désormais :
- Sélectionner et copier n'importe quelle phrase ou donnée chiffrée
- Effectuer des recherches avec Ctrl+F dans votre lecteur PDF
- Exporter le texte brut pour alimenter un traitement de données ou un CRM
- Rendre le document indexable par les moteurs de recherche si vous le mettez en ligne
Le moteur supporte plus de 40 langues dont le français, l'anglais, l'espagnol, l'arabe et le mandarin. Les documents mixtes (blocs français + anglais sur la même page) sont reconnus sans configuration. La précision atteint 97 à 99 % sur des scans de bonne qualité (300 dpi minimum recommandé).
Après traitement, vous pouvez enchaîner directement sur un outil de compression pour réduire le poids du fichier enrichi, ou passer par l'outil d'annotation pour commenter vos extraits sans retourner sur l'original.
Comment fonctionne le traitement local (WebAssembly)
La grande majorité des outils OCR en ligne envoient votre PDF vers un serveur distant qui effectue la reconnaissance, puis vous retourne le fichier. iSharePDF fonctionne différemment : le moteur Tesseract compilé en WebAssembly s'exécute directement dans votre onglet Chrome, Firefox ou Safari.
Concrètement, voici ce qui se passe quand vous déposez un fichier :
- Chargement du moteur : le module WebAssembly (~8 Mo) est téléchargé une fois et mis en cache local par le navigateur
- Analyse page par page : chaque page est rastérisée en mémoire vive, puis le moteur OCR en extrait les blocs de texte
- Génération de la couche PDF : le texte reconnu est intégré dans le fichier via la librairie PDF-lib, aussi exécutée localement
- Téléchargement : le fichier final est proposé au téléchargement sans jamais transiter par un serveur
Ce pipeline purement navigateur explique pourquoi le traitement d'un document de 10 Mo prend environ 3 secondes sur un ordinateur portable récent, contre 8 à 15 secondes pour les solutions cloud qui incluent le temps de transfert réseau aller-retour. La limite est fixée à 100 Mo par fichier, ce qui couvre la quasi-totalité des scans professionnels.
Pourquoi uploader un PDF scanné est un risque RGPD en 2026
Un relevé de compte, un contrat signé, un acte notarié ou une ordonnance médicale contient des données personnelles au sens du RGPD. Dès qu'il est envoyé vers un serveur tiers, même si le prestataire affirme "supprimer le fichier après X minutes", plusieurs problèmes légaux se posent :
- Absence de base légale : traiter des données personnelles via un outil gratuit sans DPA (Data Processing Agreement) signé expose l'entreprise utilisatrice à une infraction caractérisée
- Transfert hors UE : la plupart des services OCR cloud hébergent leurs serveurs aux États-Unis, ce qui constitue un transfert international soumis aux garanties SCCs depuis l'invalidation du Privacy Shield
- Logs et métadonnées : les serveurs conservent souvent les métadonnées de requête (nom de fichier, IP, horodatage) même quand le contenu est effacé
Avec iSharePDF, aucun octet de votre document ne sort de votre navigateur. Il n'y a physiquement pas de serveur à compromettre, pas de logs à effacer, pas de DPA à négocier. C'est la seule architecture qui garantit une conformité RGPD par conception (privacy by design) pour l'extraction de texte PDF.
Tutoriel (en 4 étapes)
L'interface est volontairement minimaliste pour ne pas ralentir un workflow professionnel :
- Étape 1, Ouvrir l'outil : rendez-vous sur /fr/app/tools/ocr depuis n'importe quel navigateur moderne. Aucune installation, aucun compte requis en version gratuite.
- Étape 2, Déposer le fichier : glissez-déposez votre PDF ou cliquez sur la zone de dépôt. Formats supportés : PDF natif contenant des images (scan smartphone, photocopie numérisée, fax archivé).
- Étape 3, Sélectionner la langue : choisissez la ou les langues présentes dans le document. Pour un document bilingue, sélectionnez les deux langues dans le menu.
- Étape 4, Télécharger : cliquez sur « Lancer l'OCR ». Une barre de progression page par page s'affiche. Le fichier PDF enrichi se télécharge automatiquement à la fin.
Pour les fichiers multi-pages (plus de 20 pages), le compte Pro traite les lots en parallèle sur 4 threads WebAssembly, divisant le temps de traitement par 3 environ. Vous pouvez ensuite scinder le résultat en chapitres si nécessaire.
Cas d'usage professionnels
L'extraction de texte sur document scanné intervient dans des contextes très variés :
- Cabinets comptables et juridiques : numérisation de contrats papier, extraction des montants pour rapprochement comptable, indexation d'archives notariales
- Ressources humaines : traitement de CV papier soumis en format image, extraction de données de formulaires CERFA
- Santé : rendu sélectionnable de comptes rendus médicaux scannés, ordonnances, bilans biologiques, avec la garantie qu'aucune donnée de santé ne part en dehors du poste
- Éducation et recherche : numérisation d'ouvrages anciens, thèses ou articles de presse pour citation et analyse textuelle
- E-commerce et logistique : extraction automatique de données depuis des bons de livraison ou factures fournisseurs numérisées
iSharePDF s'intègre aussi dans des workflows plus complexes : après l'OCR, utilisez l'outil protection par mot de passe pour sécuriser le fichier enrichi avant partage, ou fusionnez plusieurs documents traités en un seul PDF consultable.
Limites à connaître avant de commencer
L'honnêteté sur les limites fait partie de l'approche iSharePDF :
- Qualité du scan : en dessous de 150 dpi ou sur des documents très froissés, la précision peut descendre à 85-90 %. Un scan smartphone en bonne lumière et à 300 dpi donne les meilleurs résultats.
- Manuscrit : le moteur Tesseract est optimisé pour l'imprimé. L'écriture manuscrite est partiellement reconnue mais avec un taux d'erreur nettement plus élevé (50-70 % selon les graphies).
- Tableaux complexes : les cellules fusionnées ou les tableaux sans bordures visibles peuvent perdre leur structure lors de l'extraction. L'export texte brut sera lisible, mais sans mise en forme tabulaire.
- Fichiers protégés : un PDF verrouillé par mot de passe doit d'abord être déverrouillé, iSharePDF propose cette fonctionnalité dans le même tableau de bord.
- Limit gratuit : en version gratuite, les fichiers de plus de 50 pages sont traités en mode séquentiel (un thread). Le compte Pro lève cette restriction et traite jusqu'à 100 Mo sans plafond de pages.
Tarifs : gratuit ou Pro 4,99 €/mois
L'outil OCR est utilisable gratuitement sans création de compte, sans filigrane et sans limite de documents par jour. Les 28 outils du tableau de bord sont accessibles dans les mêmes conditions.
Le compte Pro à 4,99 €/mois (Stripe, résiliation en 1 clic) débloque :
- Traitement multi-thread (4× plus rapide sur les gros volumes)
- Chiffrement AES-256 des fichiers temporaires en mémoire pendant le traitement
- Priorité sur les futures fonctionnalités (OCR manuscrit bêta, export DOCX, détection de tableaux)
- Accès aux 28 outils sans aucune limitation de taille jusqu'à 100 Mo par fichier
Aucun essai gratuit limité dans le temps : la version gratuite est permanente et fonctionnelle. Le Pro s'adresse aux professionnels qui traitent de gros volumes ou des documents sensibles nécessitant le niveau de chiffrement maximal.
Questions fréquentes
Mon PDF scanné est-il vraiment traité sans connexion internet après le chargement ?
Oui. Une fois le module WebAssembly téléchargé et mis en cache par votre navigateur (premier usage uniquement), l'outil OCR fonctionne en hors-ligne complet. Vous pouvez activer le mode avion après avoir ouvert la page et le traitement se déroulera normalement. Aucun octet de votre document ne transite par un serveur iSharePDF ou tiers.
Quels formats de fichiers sont acceptés en entrée ?
L'outil accepte les fichiers PDF dont les pages sont des images raster (scans de photocopieuse, photos de document, fax numérisés). Les PDF déjà nativement textuels (générés par Word, InDesign, etc.) n'ont pas besoin d'OCR, leur texte est déjà sélectionnable. Les formats image standalone (JPG, PNG, TIFF) ne sont pas encore supportés directement ; convertissez-les d'abord en PDF via n'importe quel outil d'impression virtuelle.
La langue française avec accents et caractères spéciaux est-elle bien reconnue ?
Le français est parmi les langues les mieux supportées par Tesseract : accents (é, è, ê, à, ù, ç, œ), guillemets français (« »), apostrophes courbes et ligatures sont correctement extraits. Sur un scan de bonne qualité, le taux de reconnaissance des caractères français dépasse 98 %. Les chiffres, symboles monétaires (€) et signes de ponctuation sont également bien traités.
Est-ce qu'iSharePDF conserve une copie du texte extrait ?
Non. Le texte extrait n'existe que dans la mémoire vive de votre onglet navigateur pendant le traitement, puis dans le fichier PDF téléchargé sur votre machine. iSharePDF ne dispose d'aucune infrastructure serveur pour stocker du contenu utilisateur. Nos serveurs se limitent à servir les fichiers JavaScript et WebAssembly de l'application, c'est tout.
La version gratuite impose-t-elle un filigrane sur le fichier OCR ?
Non. La version gratuite ne pose aucun filigrane visible ni métadonnée cachée dans le PDF résultant. Le fichier téléchargé est propre et immédiatement utilisable dans n'importe quel lecteur PDF ou workflow professionnel. La distinction entre gratuit et Pro porte uniquement sur les performances de traitement et le niveau de chiffrement, pas sur la qualité du fichier produit.
Que faire si le résultat OCR contient des erreurs sur certains mots ?
Pour les erreurs ponctuelles, ouvrez le PDF dans votre lecteur et utilisez la fonction « Rechercher et remplacer » si disponible. Pour les documents critiques (contrats, actes), un scan à 300 dpi avec bonne luminosité corrige 90 % des cas d'erreur. En cas de scan très dégradé, l'option Pro bêta d'amélioration d'image (prétraitement contraste + déskew) sera disponible courant 2026 pour les abonnés.
iSharePDF