Limpeza de texto de PDF
Corrija quebras de linha e espaços indesejados no texto copiado de um PDF.
Como limpar texto copiado de PDF
- Cole o texto original para iniciar a limpeza automática. Escolha reparar parágrafos ou apenas espaços e ative alterações opcionais só quando necessário.
- Reveja os excertos atualizados e decida se cada hífen duvidoso deve ser removido, mantido na junção ou deixado intacto. Cada decisão atualiza o resultado automaticamente.
- Copie o resultado quando o processamento terminar. Alterar o texto ou as opções atualiza o resultado e repõe as decisões sobre hífens; ao escrever, aguarda-se uma breve pausa. Apagar elimina ambos os textos e restaura as opções iniciais.
O que esta ferramenta altera
Ao copiar de um PDF, cada linha visual pode tornar-se uma linha de texto. Esta ferramenta une linhas elegíveis, mas uma quebra não revela a intenção do autor. Preserva parágrafos vazios, listas reconhecidas, código delimitado ou indentado, linhas tabulares e URLs, emails e caminhos isolados. A pontuação de fim de frase também impede a junção. Títulos, poesia e citações não são reconhecidos perfeitamente: reveja ou use apenas espaços.
Um hífen no fim da linha pode dividir uma palavra ou fazer parte de uma palavra composta. Cada ocorrência tem a sua decisão e fica intacta por predefinição. O resultado parte sempre do original atual, sem acumular alterações ao repor escolhas. Limpar novamente um resultado já limpo pode revelar novas junções; a repetição não garante o mesmo resultado.
O modo automático só omite espaços entre caracteres Han adjacentes. Não identifica idiomas nem deduz todas as separações em japonês, coreano, tailandês ou khmer. As opções limitam-se a U+00AD, ff/fi/fl/ffi/ffl, U+00A0/U+202F e espaços ASCII repetidos. Estruturas protegidas ficam intactas. Tabulações, espaços finais de quebra, acentos combinantes, emoji, controlos de escrita e outros caracteres Unicode são preservados.
Exemplos: antes → depois
A wrapped ␊ sentence. → A wrapped sentence. (␊ indica uma quebra de linha, sem os espaços de apresentação à volta.)
inter-␊national → intacto por predefinição; remover o hífen produz international e mantê-lo produz inter-national. state-␊of-the-art → state-of-the-art ao manter o hífen.
中文␊文本 → 中文文本 no modo automático. file → file apenas com expansão de ligaduras. First paragraph.␊␊Second paragraph. mantém ambas as quebras.
Processamento local e limites
O texto é processado no navegador; esta ferramenta não envia nem guarda rascunhos. A análise e a publicidade partilhadas do site podem fazer pedidos de rede. Editores e excertos usam os atributos de ocultação do site. O limite de 500.000 unidades UTF-16 não conta caracteres visíveis: um emoji pode ocupar várias unidades. O texto acima do limite é preservado sem cortes.
Perguntas frequentes
Ferramentas relacionadas
Contador de caracteres e segmentos SMS
Veja a codificação da mensagem, os limites dos segmentos e o possível custo. O texto fica no seu navegador.
Abrir ferramenta — Contador de caracteres e segmentos SMSContador de caracteres para redes sociais
Confira os limites de cada plataforma e divida publicações sem perder texto.
Abrir ferramenta — Contador de caracteres para redes sociaisContador de caracteres
Conte caracteres, palavras, frases e parágrafos. Consulte a densidade de palavras, o tempo de leitura e o tamanho UTF-8 no navegador.
Abrir ferramenta — Contador de caracteresCalculadora de tamanho de texto
Compare codificações e tamanhos de dados de texto no navegador.
Abrir ferramenta — Calculadora de tamanho de texto