Очистка текста из PDF
Исправьте лишние переносы строк и пробелы в тексте из PDF.
Как очистить текст из PDF
- Вставьте исходный обычный текст — очистка начнётся автоматически. Выберите восстановление абзацев или только пробелы. Включайте дополнительные изменения лишь при необходимости.
- Проверьте обновлённые фрагменты и решите для каждого неоднозначного дефиса: удалить, сохранить при объединении или оставить исходную границу. Каждое решение автоматически обновляет результат.
- Скопируйте результат после завершения обработки. Изменение исходника или настроек обновляет результат и сбрасывает решения о дефисах; при вводе учитывается короткая пауза. Очистка полей удаляет оба текста и восстанавливает настройки по умолчанию.
Что меняет этот инструмент
При копировании из PDF каждая визуальная строка часто получает перевод строки. Инструмент объединяет подходящие строки, но сам перенос не раскрывает замысел автора. Пустые абзацы, распознанные списки, код с ограждениями или отступами, табличные строки, отдельные URL, адреса почты и пути сохраняются. Знаки завершения предложения также блокируют объединение. Заголовки, стихи и цитаты распознаются не идеально: проверяйте результат или выбирайте только пробелы.
Дефис в конце строки может разделять слово или быть частью сложного слова. Каждое вхождение проверяется отдельно и по умолчанию сохраняется. Результат всегда строится из текущего исходника, поэтому сброс решений не накапливает изменения. Повторная очистка уже очищенного текста может выявить новые объединения и не обязана давать тот же результат.
Автоматический режим убирает пробел только между соседними иероглифами хань. Он не определяет язык и не угадывает все границы в японском, корейском, тайском или кхмерском тексте. Дополнительные изменения касаются только U+00AD, ff/fi/fl/ffi/ffl, U+00A0/U+202F и повторных обычных пробелов. Защищённые блоки остаются точными. Табуляция, конечные пробелы переноса, комбинируемые знаки, эмодзи, управляющие символы письма и прочий Unicode сохраняются.
Примеры: до → после
A wrapped ␊ sentence. → A wrapped sentence. (␊ обозначает перенос строки без окружающих пробелов оформления.)
inter-␊national → без изменений по умолчанию; удаление дефиса даёт international, сохранение — inter-national. state-␊of-the-art → state-of-the-art при сохранении дефиса.
中文␊文本 → 中文文本 в автоматическом режиме. file → file только при раскрытии лигатур. В First paragraph.␊␊Second paragraph. сохраняются оба переноса.
Локальная обработка и ограничения
Текст обрабатывается в браузере: инструмент не отправляет и не сохраняет черновики. Общие службы аналитики и рекламы сайта могут выполнять сетевые запросы. Редакторы и фрагменты проверки используют атрибуты маскирования сайта. Лимит в 500 000 единиц UTF-16 не равен числу видимых символов: эмодзи могут занимать несколько единиц. Превышающий лимит текст сохраняется без обрезки.
Частые вопросы
Похожие инструменты
Счётчик символов и сегментов SMS
Узнайте кодировку сообщения, границы сегментов и примерную стоимость. Текст остаётся в вашем браузере.
Открыть инструмент — Счётчик символов и сегментов SMSСчётчик символов для соцсетей
Проверяйте лимиты платформ и разбивайте публикации без потери текста.
Открыть инструмент — Счётчик символов для соцсетейСчётчик символов
Считайте символы, слова, предложения и абзацы. Проверяйте плотность слов, время чтения и размер UTF-8 прямо в браузере.
Открыть инструмент — Счётчик символовКалькулятор размера текста
Сравнивайте кодировки и размеры передаваемого текста прямо в браузере.
Открыть инструмент — Калькулятор размера текста