字数与字符统计
统计空白分隔词段、Unicode 码点、句段和段落
完整说明还包括常见问题处理、操作示例、代码片段、FAQ 和相关工具,便于核对结果或排查问题。
工具说明
粘贴文本后,可查看空白分隔词段、包含与不含空白的 Unicode 码点、CJK 码点、句段估计及空行分隔段落。这里采用明确的计数约定:不含空格的中文句子是一个词段,汉字另外按 CJK 码点统计;一个组合 emoji 可能包含多个码点。高频词只提取拉丁字母词并过滤常见英语停用词。阅读与朗读时间按拉丁字母词和 CJK 码点的固定速度估算,不代表某位读者的实际速度。英语 Flesch 估计仅在 ASCII 文本且拉丁字母词超过十个时显示,音节数使用简化规则。文本只留在当前页面,不保存输入草稿。
场景配方
对照混合文字计数
目标:在应用长度限制前理解工具口径。
- 输入 Hi 😀 中。
- 对照空白分隔词段、Unicode 码点与 CJK 码点。
结果:3 个词段、含空格 6 个码点、不含空白 4 个码点、1 个 CJK 码点。
推荐工作流
生产可用片段
计算示例
text
Hi 😀 中 → 词段3;码点6;CJK 1
👨👩👧👦 → 码点7失败门诊(高频踩坑)
家庭表情占多个码点
原因:工具不进行字素簇切分。
修复:如果限制按视觉字符计算,应使用接收编辑器的规则。
常见问题
主要的词数采用什么口径?
按空白切分非空词段。例如“Hi 😀 中”有 3 个词段、6 个 Unicode 码点及 1 个 CJK 码点。只有标点的非空词段也会计数。
字符数等于肉眼看到的符号数量吗?
不等于。这里统计 Unicode 码点,不是 UTF-16 码元、字节或字素簇。😀 是 1 个码点,家庭 emoji 👨👩👧👦 则包含 7 个。
句子和段落如何统计?
句段按 . ! ? 及对应中文标点分隔;段落按空行分隔,CRLF 和 CR 会先统一换行。缩写和标点写法会影响句段估计。
阅读时间和可读性如何估算?
阅读按每分钟 200 个拉丁字母词、400 个 CJK 码点,朗读按 130 和 250 估算;其他文字体系未建模。Flesch 采用英语音节启发式,非 ASCII 或短文本不显示。
为什么其他编辑器统计不同?
编辑器可能采用不同的分词、标点或字素规则。提交字数限制应以接收平台为准;本工具不会依据长度判断文章质量或 SEO 价值。
继续浏览