PDF 文本清理工具
修复从 PDF 复制的文本中多余的换行和空格。
如何清理 PDF 复制文本
- 粘贴原始纯文本即可自动开始清理。选择修复段落换行或仅处理空格,并仅在需要时启用其他修改。
- 检查更新后的片段,逐一决定不确定的连字符是删除、在合并时保留,还是保持原始边界。每次选择都会自动更新结果。
- 处理完成后复制清理结果。更改原文或设置会更新结果并重置连字符选择;输入文字时会等待短暂停顿。清空操作会删除两份文本并恢复默认设置。
此工具会修改什么
从 PDF 复制文本时,视觉上的每行末尾常被转换成换行符。本工具合并符合规则的行,但仅凭换行无法判断作者的意图。空段落、识别出的列表、围栏代码或缩进代码、表格行、独立 URL、电子邮件和路径会保留。句末标点也会阻止合并。标题、诗歌和引文无法完全识别,请检查修改,或使用仅处理空格模式。
行末连字符可能是断词标记,也可能属于复合词。每个位置独立选择,默认不修改。修复始终基于当前原文,因此重置选择不会叠加先前的修改。再次清理已经清理过的结果可能出现新的可合并位置,不能保证结果始终相同。
自动模式仅在相邻汉字之间省略空格。它不是语言识别,也无法推断所有日语、韩语、泰语或高棉语边界。可选修改仅涉及 U+00AD、ff/fi/fl/ffi/ffl、U+00A0/U+202F 和连续 ASCII 空格。受保护结构保持原样。制表符、行末硬换行空格、组合附加符号、表情符号、文字塑形控制符和其他 Unicode 字符均保留。
示例:清理前 → 清理后
A wrapped ␊ sentence. → A wrapped sentence.(␊ 表示换行,不含示例排版中的两侧空格。)
inter-␊national → 默认保持不变;删除连字符得到 international,保留则得到 inter-national。state-␊of-the-art → 选择保留连字符后得到 state-of-the-art。
中文␊文本 → 自动模式得到中文文本。file → 仅启用连字展开时得到 file。First paragraph.␊␊Second paragraph. 保留两个换行。
本地处理与限制
文本在浏览器中处理,此工具不上传或持久保存草稿。网站共用的分析和广告服务仍可能发出网络请求。编辑器和检查片段使用网站的内容遮蔽属性。500,000 个 UTF-16 代码单元并不等于可见字符数,表情符号可能占多个单元。超出上限的文本会完整保留,不会被截断。
