比较 PDF 文字
比较相同位置的提取文字与页存在性
PDF 文本比较
🔒 100% 本地运行 — 你的数据不会离开当前页面由 Evan 维护•最近更新:2026年9月30日
⏳加载工具中…
工具说明
本工具比较 PDF A 与 B 相同页位置的源顺序提取文字。缺失页不同于已存在但没有文字的页;JSON 保留双方存在性标志,并区分 null 与空字符串。可选空白模式在比较前移除提取文字中的 JavaScript 空白字符,但 PDF.js 可能已规范部分源空格。两个无文字扫描件会返回无文字可比较状态,同时仍报告页存在性差异。文字相同不能证明视觉、排版、图像或签名相同。替换任一输入或修改选项会清除旧结果。完整 JSON 捕获双方文件名与比较选项。每个 PDF 最大 20 MiB、200 页、4 MiB 文字和 100,000 个文字项。
场景配方
01
区分多出的空白页
目标:比较相同位置的提取文字与页存在性
- A 选择一页空白 PDF,B 选择两页空白 PDF。
- 比较文字,检查页存在性差异数量。
- 下载 JSON,检查第 2 页的 existsA=false。
结果:没有文字可比较,但有一个页位置不同。
失败门诊(高频踩坑)
两个纯图片 PDF 会被判定相同吗?
原因:不会。没有可提取文字时显示无文字可比较,仍报告多出或缺少的页位置。
修复:比较扫描文字前先 OCR;比较图像或排版差异时使用视觉比较工具。
忽略空白会移除什么?
原因:移除已提取文字中的 JavaScript 空白字符,不恢复 PDF 提取过程中已丢失的源空格。
修复:提取后的空格有意义时关闭该选项,并检查 JSON 中的 textA/textB。
生产可用片段
区分多出的空白页
text
{"page":2,"existsA":false,"existsB":true,"textA":null,"textB":"","equal":false}常见问题
两个纯图片 PDF 会被判定相同吗?
不会。没有可提取文字时显示无文字可比较,仍报告多出或缺少的页位置。
忽略空白会移除什么?
移除已提取文字中的 JavaScript 空白字符,不恢复 PDF 提取过程中已丢失的源空格。
缺页与空白页有区别吗?
有。缺页的 exists=false、text=null;存在的空白页为 exists=true、空字符串。
继续浏览