Любимые места любимого города
Главная
Добавить в предпочтительные источники Google

Очистка текста из PDF

Исправьте лишние переносы строк и пробелы в тексте из PDF.

Вставьте или введите текст из PDF.

Обновляется автоматически. Исходник остаётся доступен.

Как это работает и ограничения

Вставьте обычный текст — очистка начнётся автоматически. Изменение настроек обновляет результат, а ввод текста — после короткой паузы. Исходник сохраняется, пока вы его не измените или не удалите.

Лимит обработки — 500 000 кодовых единиц UTF-16, а не видимых символов. Более длинный текст остаётся в редакторе, но не обрабатывается.

Текст обрабатывается локально в браузере. Инструмент не сохраняет и не отправляет черновики. Общие службы сайта могут выполнять сетевые запросы.

Настройки очистки

Восстановление переносов основано на предположениях. Пустые строки и распознанные списки, код, таблицы и отдельные ссылки защищены. Для неоднозначной разметки выберите «Только пробелы».

Автоматический режим не добавляет пробел только между соседними иероглифами хань; в остальных случаях вставляет один пробел. Язык текста не определяется.

Вставьте текст для начала. Очистка запускается автоматически.

Как очистить текст из PDF

  1. Вставьте исходный обычный текст — очистка начнётся автоматически. Выберите восстановление абзацев или только пробелы. Включайте дополнительные изменения лишь при необходимости.
  2. Проверьте обновлённые фрагменты и решите для каждого неоднозначного дефиса: удалить, сохранить при объединении или оставить исходную границу. Каждое решение автоматически обновляет результат.
  3. Скопируйте результат после завершения обработки. Изменение исходника или настроек обновляет результат и сбрасывает решения о дефисах; при вводе учитывается короткая пауза. Очистка полей удаляет оба текста и восстанавливает настройки по умолчанию.

Что меняет этот инструмент

При копировании из PDF каждая визуальная строка часто получает перевод строки. Инструмент объединяет подходящие строки, но сам перенос не раскрывает замысел автора. Пустые абзацы, распознанные списки, код с ограждениями или отступами, табличные строки, отдельные URL, адреса почты и пути сохраняются. Знаки завершения предложения также блокируют объединение. Заголовки, стихи и цитаты распознаются не идеально: проверяйте результат или выбирайте только пробелы.

Дефис в конце строки может разделять слово или быть частью сложного слова. Каждое вхождение проверяется отдельно и по умолчанию сохраняется. Результат всегда строится из текущего исходника, поэтому сброс решений не накапливает изменения. Повторная очистка уже очищенного текста может выявить новые объединения и не обязана давать тот же результат.

Автоматический режим убирает пробел только между соседними иероглифами хань. Он не определяет язык и не угадывает все границы в японском, корейском, тайском или кхмерском тексте. Дополнительные изменения касаются только U+00AD, ff/fi/fl/ffi/ffl, U+00A0/U+202F и повторных обычных пробелов. Защищённые блоки остаются точными. Табуляция, конечные пробелы переноса, комбинируемые знаки, эмодзи, управляющие символы письма и прочий Unicode сохраняются.

Примеры: до → после

A wrapped ␊ sentence. → A wrapped sentence. (␊ обозначает перенос строки без окружающих пробелов оформления.)

inter-␊national → без изменений по умолчанию; удаление дефиса даёт international, сохранение — inter-national. state-␊of-the-art → state-of-the-art при сохранении дефиса.

中文␊文本 → 中文文本 в автоматическом режиме. file → file только при раскрытии лигатур. В First paragraph.␊␊Second paragraph. сохраняются оба переноса.

Локальная обработка и ограничения

Текст обрабатывается в браузере: инструмент не отправляет и не сохраняет черновики. Общие службы аналитики и рекламы сайта могут выполнять сетевые запросы. Редакторы и фрагменты проверки используют атрибуты маскирования сайта. Лимит в 500 000 единиц UTF-16 не равен числу видимых символов: эмодзи могут занимать несколько единиц. Превышающий лимит текст сохраняется без обрезки.

Частые вопросы

Нет, принимается только вставленный обычный текст. Для сканов сначала нужен OCR в другом инструменте. Утраченные колонки, таблицы и порядок чтения не восстанавливаются; номера страниц, повторные заголовки и цитаты не удаляются.

Дефис сложного слова и знак переноса могут выглядеть одинаково. При сомнении оставьте исходную границу и проверяйте каждое вхождение отдельно.

Прочитайте объединённые строки в контексте. Связанные инструменты ниже помогут посчитать символы, измерить размер кодированного текста и оценить сегменты SMS.

Счётчик символов и сегментов SMS

Узнайте кодировку сообщения, границы сегментов и примерную стоимость. Текст остаётся в вашем браузере.

Открыть инструментСчётчик символов и сегментов SMS

Счётчик символов для соцсетей

Проверяйте лимиты платформ и разбивайте публикации без потери текста.

Открыть инструментСчётчик символов для соцсетей

Счётчик символов

Считайте символы, слова, предложения и абзацы. Проверяйте плотность слов, время чтения и размер UTF-8 прямо в браузере.

Открыть инструментСчётчик символов

Калькулятор размера текста

Сравнивайте кодировки и размеры передаваемого текста прямо в браузере.

Открыть инструментКалькулятор размера текста