Les lieux préférés de votre ville préférée
Accueil
Ajouter aux sources préférées sur Google

Nettoyage de texte PDF

Corrigez les retours à la ligne et les espaces indésirables du texte copié depuis un PDF.

Collez ou saisissez du texte copié depuis un PDF.

Mise à jour automatique. L’original reste disponible.

Fonctionnement et limites de saisie

Collez du texte brut pour le nettoyer automatiquement. Les options actualisent le résultat ; pendant la saisie, il se met à jour après une courte pause. L’original reste disponible jusqu’à sa modification ou son effacement.

Limite : 500 000 unités de code UTF-16, et non caractères visibles. Un texte plus long reste dans l’éditeur mais ne peut pas être traité.

Le texte est traité localement dans votre navigateur. Cet outil n’enregistre ni ne transmet les brouillons. Les services partagés du site peuvent effectuer des requêtes réseau.

Options de nettoyage

La réparation repose sur des heuristiques. Les lignes vides et les listes, codes, tableaux et liens isolés reconnus sont protégés. En cas de doute, choisissez Espaces uniquement.

Le mode automatique omet l’espace uniquement entre deux caractères Han adjacents ; sinon, il insère une espace. Il ne détecte pas la langue.

Collez du texte pour commencer. Le nettoyage démarre automatiquement.

Comment nettoyer un texte copié depuis un PDF

  1. Collez le texte original pour lancer le nettoyage automatique. Choisissez la réparation des paragraphes ou des espaces uniquement, puis activez les modifications facultatives si nécessaire.
  2. Vérifiez les extraits actualisés et décidez pour chaque trait d’union s’il faut le supprimer, le garder en joignant les lignes ou ne rien changer. Chaque choix actualise automatiquement le résultat.
  3. Copiez le résultat à la fin du traitement. Modifier le texte ou les options actualise le résultat et réinitialise les choix de césure ; la saisie attend une courte pause. Effacer supprime les deux textes et restaure les options initiales.

Ce que modifie cet outil

La copie d’un PDF insère souvent un retour à chaque fin de ligne visuelle. L’outil joint les lignes admissibles, mais un retour ne révèle pas l’intention de l’auteur. Il conserve les paragraphes vides, les listes reconnues, le code délimité ou indenté, les lignes tabulaires et les URL, courriels et chemins isolés. La ponctuation de fin de phrase empêche aussi la jonction. Titres, poésie et citations ne sont pas parfaitement reconnus : vérifiez ou choisissez Espaces uniquement.

Un trait d’union en fin de ligne peut couper un mot ou appartenir à un composé. Chaque occurrence a son propre choix et reste intacte par défaut. Le résultat repart toujours de l’original actuel, sans cumuler les modifications lors d’une réinitialisation. Nettoyer à nouveau un résultat peut révéler de nouvelles jonctions : le résultat n’est pas nécessairement identique.

Le mode automatique omet les espaces uniquement entre caractères Han adjacents. Il ne détecte pas la langue et ne déduit pas toutes les séparations du japonais, du coréen, du thaï ou du khmer. Les options concernent uniquement U+00AD, ff/fi/fl/ffi/ffl, U+00A0/U+202F et les espaces ASCII répétés. Les structures protégées restent exactes. Tabulations, espaces finales de saut, accents combinés, emoji, contrôles d’écriture et autres caractères Unicode sont conservés.

Exemples : avant → après

A wrapped ␊ sentence. → A wrapped sentence. (␊ désigne un retour à la ligne, sans les espaces de présentation qui l’entourent.)

inter-␊national → inchangé par défaut ; supprimer le trait donne international, le conserver donne inter-national. state-␊of-the-art → state-of-the-art en conservant le trait.

中文␊文本 → 中文文本 en mode automatique. file → file uniquement avec le développement des ligatures. First paragraph.␊␊Second paragraph. conserve les deux retours.

Traitement local et limites

Le texte est traité dans le navigateur ; l’outil ne transmet ni ne conserve les brouillons. Les services partagés de statistiques et de publicité peuvent effectuer des requêtes réseau. Les éditeurs et extraits utilisent les attributs de masquage du site. La limite de 500 000 unités UTF-16 ne compte pas les caractères visibles : un emoji peut occuper plusieurs unités. Le texte trop long reste intégralement disponible.

Questions fréquentes

Non. Collez uniquement du texte brut. Un PDF numérisé nécessite d’abord un OCR externe. L’outil ne reconstitue pas les colonnes, tableaux ou l’ordre de lecture perdus. Il ne supprime ni numéros de page, ni en-têtes répétés, ni citations.

Un trait d’union de mot composé et une césure typographique peuvent être identiques. En cas de doute, conservez la coupure d’origine et vérifiez chaque occurrence.

Relisez les lignes jointes dans leur contexte. Les outils associés ci-dessous permettent de compter les caractères, de mesurer la taille du texte encodé ou de calculer les segments SMS.

Compteur de caractères et de segments SMS

Découvrez l’encodage du message, les limites de ses segments et son coût possible. Le texte reste dans votre navigateur.

Ouvrir l’outilCompteur de caractères et de segments SMS

Compteur de caractères pour réseaux sociaux

Vérifiez les limites des plateformes et divisez vos publications sans perdre de texte.

Ouvrir l’outilCompteur de caractères pour réseaux sociaux

Compteur de caractères

Comptez les caractères, mots, phrases et paragraphes. Consultez la densité des mots, le temps de lecture et la taille UTF-8 dans votre navigateur.

Ouvrir l’outilCompteur de caractères

Calculateur de taille de texte

Comparez les encodages et la taille des données textuelles dans votre navigateur.

Ouvrir l’outilCalculateur de taille de texte