文本大小计算器
在浏览器中比较文本编码和载荷大小。
如何使用计算器
- 粘贴文本或检查本地文本文件。编辑器初始为空,并保留原始换行符。
- 选择编码、换行转换和可选 BOM,查看精确字节数并比较序列化表示。
- 可为 API 所需的表示设置字节预算。通过明确的复制操作获取原始文本、摘要或完整编码输出。
- 查看突出显示的大小,单位会自动选择为字节、KB、MB 或 GB(更大数值使用 TB/PB)。精确字节数保留在下方及其他较大结果旁。易读大小会四舍五入,预算检查始终使用精确字节数。
理解字节、编码和载荷
一个字节为八位;一个可见字符可能包含多个 Unicode 码点。😀 是一个字素、一个码点和两个 UTF-16 码元,在 UTF-8、UTF-16 和 UTF-32 中均为 4 字节。组合标记和 ZWJ 表情序列使字符数与字节数不同。
UTF-8 每个 Unicode 标量使用 1–4 字节,UTF-16 使用 2 或 4 字节,UTF-32 使用 4 字节。A 分别占 1/2/4 字节。西里尔文、阿拉伯文、中文和表情符号都是有效文本,即使需要更多字节。这是编码内容大小,不是 JavaScript 堆内存或磁盘分配空间。
不执行规范化、去除首尾空白或删除不可见字符。预组合 é 占 2 个 UTF-8 字节,e + U+0301 占 3 个,两者通常都是一个字素。源文本保留不变,只有所选换行转换用于生成计算所需的有效文本。
新增 BOM 在 UTF-8 中占 3 字节、UTF-16 中占 2 字节、UTF-32 中占 4 字节,空文本也一样。文本开头已有的 U+FEFF 仍作为内容。LF 占一个 ASCII 字节,CRLF 占两个。转换将 CRLF 作为整体处理,再处理单独的 CR/LF,保留 NEL、U+2028 和 U+2029。
对于 A 空格 B,UTF-8 为 3 字节,URL 输出 A%20B 为 5 字节,表单值 A+B 为 3 字节。A 后接 CRLF 再接 B 为 4 个 UTF-8 字节,转为 LF 后是 3 个;保留 CRLF 的 JSON 字符串为 8 字节。JSON 包含外层引号和转义,把输入作为一个字符串序列化,不是压缩 JSON 文档。
Base64 是编码,不是压缩或加密。标准带填充输出为 4 × ceil(byteLength / 3) 个 ASCII 字节,长输入的开销接近三分之一。UTF-8 的 A 变为 QQ==(4 字节)。无 BOM 的空输入产生空 Base64,但空 JSON 字符串仍占 2 字节。
File.size 是不可变的原始字节数,包含签名。文件导入支持 UTF-8 和 UTF-16LE/BE,并严格解码。识别到的 BOM 选择解码器且只移除一次,额外的 U+FEFF 内容保留。无签名时假定 UTF-8,并非可靠自动检测。重新编码可能因编码、换行、BOM 策略或编辑而不同。
对于 API 字段限制,请确认服务计算的是原始文本、JSON 字符串还是 URL/表单数据。本工具不包含属性名、外层对象、字段名、等号和 HTTP 头。零预算仅接受空表示,等于预算时恰好符合。数据库和平台规则可能不同。字数、社交平台限制和短信分段请使用相关工具。
本地处理与范围
处理在本地进行。本工具不会上传输入的文本或文件。网站共用的分析和广告服务可能发送网络请求。
