Nettoyage de texte PDF
Corrigez les retours à la ligne et les espaces indésirables du texte copié depuis un PDF.
Comment nettoyer un texte copié depuis un PDF
- Collez le texte original pour lancer le nettoyage automatique. Choisissez la réparation des paragraphes ou des espaces uniquement, puis activez les modifications facultatives si nécessaire.
- Vérifiez les extraits actualisés et décidez pour chaque trait d’union s’il faut le supprimer, le garder en joignant les lignes ou ne rien changer. Chaque choix actualise automatiquement le résultat.
- Copiez le résultat à la fin du traitement. Modifier le texte ou les options actualise le résultat et réinitialise les choix de césure ; la saisie attend une courte pause. Effacer supprime les deux textes et restaure les options initiales.
Ce que modifie cet outil
La copie d’un PDF insère souvent un retour à chaque fin de ligne visuelle. L’outil joint les lignes admissibles, mais un retour ne révèle pas l’intention de l’auteur. Il conserve les paragraphes vides, les listes reconnues, le code délimité ou indenté, les lignes tabulaires et les URL, courriels et chemins isolés. La ponctuation de fin de phrase empêche aussi la jonction. Titres, poésie et citations ne sont pas parfaitement reconnus : vérifiez ou choisissez Espaces uniquement.
Un trait d’union en fin de ligne peut couper un mot ou appartenir à un composé. Chaque occurrence a son propre choix et reste intacte par défaut. Le résultat repart toujours de l’original actuel, sans cumuler les modifications lors d’une réinitialisation. Nettoyer à nouveau un résultat peut révéler de nouvelles jonctions : le résultat n’est pas nécessairement identique.
Le mode automatique omet les espaces uniquement entre caractères Han adjacents. Il ne détecte pas la langue et ne déduit pas toutes les séparations du japonais, du coréen, du thaï ou du khmer. Les options concernent uniquement U+00AD, ff/fi/fl/ffi/ffl, U+00A0/U+202F et les espaces ASCII répétés. Les structures protégées restent exactes. Tabulations, espaces finales de saut, accents combinés, emoji, contrôles d’écriture et autres caractères Unicode sont conservés.
Exemples : avant → après
A wrapped ␊ sentence. → A wrapped sentence. (␊ désigne un retour à la ligne, sans les espaces de présentation qui l’entourent.)
inter-␊national → inchangé par défaut ; supprimer le trait donne international, le conserver donne inter-national. state-␊of-the-art → state-of-the-art en conservant le trait.
中文␊文本 → 中文文本 en mode automatique. file → file uniquement avec le développement des ligatures. First paragraph.␊␊Second paragraph. conserve les deux retours.
Traitement local et limites
Le texte est traité dans le navigateur ; l’outil ne transmet ni ne conserve les brouillons. Les services partagés de statistiques et de publicité peuvent effectuer des requêtes réseau. Les éditeurs et extraits utilisent les attributs de masquage du site. La limite de 500 000 unités UTF-16 ne compte pas les caractères visibles : un emoji peut occuper plusieurs unités. Le texte trop long reste intégralement disponible.
Questions fréquentes
Outils associés
Compteur de caractères et de segments SMS
Découvrez l’encodage du message, les limites de ses segments et son coût possible. Le texte reste dans votre navigateur.
Ouvrir l’outil — Compteur de caractères et de segments SMSCompteur de caractères pour réseaux sociaux
Vérifiez les limites des plateformes et divisez vos publications sans perdre de texte.
Ouvrir l’outil — Compteur de caractères pour réseaux sociauxCompteur de caractères
Comptez les caractères, mots, phrases et paragraphes. Consultez la densité des mots, le temps de lecture et la taille UTF-8 dans votre navigateur.
Ouvrir l’outil — Compteur de caractèresCalculateur de taille de texte
Comparez les encodages et la taille des données textuelles dans votre navigateur.
Ouvrir l’outil — Calculateur de taille de texte