DOCUMENTS PRÊTS À MODIFIER

PDF vers Word : quand extraire le texte ou utiliser l’OCR

Choisissez un mode de lecture, vérifiez la source et créez des paragraphes modifiables sans oublier le texte dans les images.

ToolMellow ·

Essayez de sélectionner une phrase

Un PDF peut contenir du texte, des images de texte ou les deux. Le texte existant peut souvent être lu sans reconnaissance optique de caractères. Une page numérisée nécessite généralement l’OCR pour reconnaître les lettres de son image. La sélection est un premier contrôle utile, mais un titre sélectionnable ne prouve pas que le reste de la page possède une couche de texte.

Choisissez le mode selon le contenu de la page

Le mode Automatique de ToolMellow lit la couche de texte existante et utilise la langue OCR choisie uniquement sur les pages où il ne trouve aucun texte. Cela convient aux documents séparant pages de texte natif et pages numérisées. Si une page associe un titre sélectionnable à une facture scannée, choisissez l’OCR pour toutes les pages sélectionnées afin de prendre aussi en compte les mots de l’image. L’OCR peut faire des erreurs même sur une source apparemment nette.

Choisissez la langue imprimée

Sélectionnez anglais, chinois simplifié, hindi, espagnol, français, arabe, bengali, allemand, italien ou portugais avant de lire des scans. Une langue s’applique à toute la tâche. Lisez des plages distinctes si le document change de langue ; détection automatique et traduction ne sont pas proposées. Seul le modèle choisi est téléchargé quand l’OCR est nécessaire. Le texte PDF existant fonctionne sans téléchargement OCR. Changer de langue efface la révision et le téléchargement précédents pour éviter de les confondre avec un nouveau résultat.

Comparez avant d’exporter

La révision montre la page source et le texte modifiable ou les blocs reconstruits. Vérifiez noms, dates, montants, numéros de compte, ponctuation, cellules et ordre de lecture. L’extraction peut omettre des valeurs de formulaire ou produire un ordre inattendu. La confiance OCR est une estimation du moteur, pas une garantie d’exactitude d’un nombre. Corrigez la version choisie avant de créer le Word ; texte brut et structure gardent des modifications séparées.

Choisissez des paragraphes simples ou une structure révisée

Activez Reconstruire la structure avant la lecture pour détecter paragraphes, titres balisés et listes simples, zones à une ou deux colonnes, tableaux balisés ou simplement alignés, styles de base et recadrages de figures pris en charge. Vérifiez niveaux de titres, styles de liste, imbrication et numéros. Les libellés personnalisés restent du texte ; les listes traversant des pages source gardent leurs débuts visibles sous forme de listes Word séparées. Modifiez les cellules, réordonnez les blocs, déplacez-les entre colonnes et découpez les figures manquantes depuis la page. Cela crée du contenu Word natif modifiable avec les noms de familles de polices et couleurs de texte unies pris en charge, y compris les styles mixtes des paragraphes et cellules. Modifier le texte conserve les styles hors du passage changé. Vérifiez les commandes de police, couleur et soulignement manuel ; les polices absentes sont remplacées car elles ne sont pas incorporées. Transparence, motifs, texte dessiné sans correspondance fiable, position exacte, liens et formulaires interactifs ne sont pas conservés. Dimensions source, Letter et A4 sont disponibles ; le texte peut se redistribuer sur davantage de pages. Gardez le PDF si son apparence exacte compte.

Travaillez par plages raisonnables

Choisissez jusqu’à 50 pages source, dont au plus 10 pages OCR, dans un PDF de 50 MB maximum. Une plage comme 2-4, 7 réduit le travail et facilite une révision soignée. L’OCR vise l’anglais, le chinois simplifié, le hindi, l’espagnol, le français, l’arabe, le bengali, l’allemand, l’italien ou le portugais imprimés ; la structure exige des scans droits car elle utilise la position des mots reconnus. Scans flous, écriture manuscrite, mises en page complexes et autres langues demandent une autre méthode. L’outil arrête les tâches dépassant ses limites locales de rendu ou de temps.

Comptez le texte révisé

Compter le texte révisé ouvre le compteur avec le même contenu que Télécharger le texte révisé, dans l’ordre des pages choisi. La version sélectionnée, texte brut ou structure, inclut les modifications des cellules et listes. Les figures ne deviennent pas des mots. Le transfert est à usage unique et reste en mémoire de l’onglet, sans texte dans l’URL ni le stockage du navigateur. Le compteur accepte un million de caractères, séparateurs de pages compris ; un texte plus long reste téléchargeable. Effacer dans le compteur supprime le texte transmis et son historique d’annulation.

Gardez le résultat avant de fermer

PDF, mot de passe, modifications et résultat restent en mémoire de l’onglet. Le moteur et le modèle de langue choisi sont chargés depuis ToolMellow au besoin ; le document n’est pas envoyé. Téléchargez le DOCX avant d’actualiser ou de partir, puis ouvrez-le dans votre traitement de texte et vérifiez-le encore.

Passez à la pratique.