您最喜欢的城市的最爱地点
首页
添加为 Google 首选来源

PDF 文本清理工具

修复从 PDF 复制的文本中多余的换行和空格。

粘贴或输入从 PDF 复制的文本。

结果自动更新,原文始终保留。

工作方式与输入限制

粘贴纯文本即可自动清理。更改设置会更新结果;输入文字时,会在短暂停顿后更新。原文会保留,直到您编辑或清空它。

处理上限:500,000 个 UTF-16 代码单元,并非可见字符数。超长文本会留在编辑器中,但无法处理。

文本在您的浏览器中本地处理。此工具不会保存或上传草稿。网站的共享服务仍可能发起网络请求。

清理设置

换行修复基于启发式规则。空行及识别出的列表、代码、表格和独立链接会受到保护。布局不明确时,请使用仅处理空格模式。

自动模式仅在相邻汉字之间省略空格,其他情况插入一个空格。这不是语言识别。

粘贴文本即可开始,清理会自动运行。

如何清理 PDF 复制文本

  1. 粘贴原始纯文本即可自动开始清理。选择修复段落换行或仅处理空格,并仅在需要时启用其他修改。
  2. 检查更新后的片段,逐一决定不确定的连字符是删除、在合并时保留,还是保持原始边界。每次选择都会自动更新结果。
  3. 处理完成后复制清理结果。更改原文或设置会更新结果并重置连字符选择;输入文字时会等待短暂停顿。清空操作会删除两份文本并恢复默认设置。

此工具会修改什么

从 PDF 复制文本时,视觉上的每行末尾常被转换成换行符。本工具合并符合规则的行,但仅凭换行无法判断作者的意图。空段落、识别出的列表、围栏代码或缩进代码、表格行、独立 URL、电子邮件和路径会保留。句末标点也会阻止合并。标题、诗歌和引文无法完全识别,请检查修改,或使用仅处理空格模式。

行末连字符可能是断词标记,也可能属于复合词。每个位置独立选择,默认不修改。修复始终基于当前原文,因此重置选择不会叠加先前的修改。再次清理已经清理过的结果可能出现新的可合并位置,不能保证结果始终相同。

自动模式仅在相邻汉字之间省略空格。它不是语言识别,也无法推断所有日语、韩语、泰语或高棉语边界。可选修改仅涉及 U+00AD、ff/fi/fl/ffi/ffl、U+00A0/U+202F 和连续 ASCII 空格。受保护结构保持原样。制表符、行末硬换行空格、组合附加符号、表情符号、文字塑形控制符和其他 Unicode 字符均保留。

示例:清理前 → 清理后

A wrapped ␊ sentence. → A wrapped sentence.(␊ 表示换行,不含示例排版中的两侧空格。)

inter-␊national → 默认保持不变;删除连字符得到 international,保留则得到 inter-national。state-␊of-the-art → 选择保留连字符后得到 state-of-the-art。

中文␊文本 → 自动模式得到中文文本。file → 仅启用连字展开时得到 file。First paragraph.␊␊Second paragraph. 保留两个换行。

本地处理与限制

文本在浏览器中处理,此工具不上传或持久保存草稿。网站共用的分析和广告服务仍可能发出网络请求。编辑器和检查片段使用网站的内容遮蔽属性。500,000 个 UTF-16 代码单元并不等于可见字符数,表情符号可能占多个单元。超出上限的文本会完整保留,不会被截断。

常见问题

不可以,只接受粘贴的纯文本。扫描 PDF 需先在其他工具中进行 OCR。本工具无法恢复丢失的分栏、表格或阅读顺序,也不会删除页码、重复页眉或引文。

复合词中的连字符和排版断词符可能看起来完全相同。不确定时请保留原始边界,并逐一检查。

结合上下文阅读合并后的行。下方相关工具可用于统计字符、测量编码后的文本大小,或计算短信分段。

SMS 短信字数与分段计算器

了解短信的编码方式、分段位置和预计费用。文本始终保留在您的浏览器中。

打开工具SMS 短信字数与分段计算器

社交媒体字符计数器

按平台规则检查长度,无损拆分帖子。

打开工具社交媒体字符计数器

字符计数器

统计字符、词语、句子和段落,并在浏览器中查看词语密度、预计阅读时间和 UTF-8 大小。

打开工具字符计数器

文本大小计算器

在浏览器中比较文本编码和载荷大小。

打开工具文本大小计算器