PDF OCR 文字识别
识别扫描像素,按原始显示尺寸重建可搜索 PDF
工具说明
渲染选定的可见 PDF 页面,并用任务独占的 Tesseract Worker 识别像素。可选英文、简体中文或混合模型,自动版面、单文字块或稀疏文字,以及 1.5×、2×、2.5× 渲染。完整 TXT/JSON 包含源页码和 OCR 置信度估计。可选的可搜索 PDF 会同步缩放图像与隐藏文字,保持包含 CropBox、旋转和 UserUnit 在内的原始物理显示尺寸;不保留原矢量、表单、注释、链接、书签或签名。输入最多 75 MiB、1000 页,一次选择最多 40 页,每页 1600 万像素、合计 8000 万像素。语言包按需下载,文档留在本地。全部无文字或失败任务不生成完成结果,也不导出部分内容。
推荐工作流
场景配方
把图片型发票变成可搜索文字
目标:比较两种分辨率下的识别结果,同时保持物理页面尺寸。
- 载入两页图片型示例,选择第 1 页、English、单个文字块和 1.5×,开启可搜索 PDF。
- 运行 OCR,核对 Invoice 2026-0930 与 Total USD 128.50,然后下载 TXT、JSON 和 PDF。
- 改为 2.5× 再识别,核对金额、PDF 文字选择位置,并确认两个输出都保持 800 × 250 pt 页面尺寸。
结果:得到经核对的可搜索栅格 PDF 与完整文本导出;提高倍率只改变图像分辨率,不改变物理纸张大小。
失败门诊(高频踩坑)
新 PDF 没有可编辑矢量或表单字段
原因:输出由页面渲染图与隐藏 OCR 文字重建,不复制源文档结构。
修复:保留原件。已有可选文字足够使用时改用文字层提取器,并在替换任何文件前检查新 PDF。
置信度较高却出现错误金额或阅读顺序
原因:置信度是引擎估计;表格、多栏、混合语言和低质量扫描仍可能误识别。
修复:选择匹配的语言和版面,逐项对照源文件数字,并在像素预算内尝试提高倍率。OCR 不是表格转电子表格工具。
识别中断或没有找到文字
原因:语言包可能加载失败,页面可能超过渲染预算,扫描件也可能没有可识别文字。
修复:加载失败时重试;预算错误时减少页数或降低倍率;无文字时尝试更清晰扫描或其他语言。不导出部分结果。
生产可用片段
分辨率变化不改变物理页面
text
源显示尺寸:800 × 250 pt
1.5× 渲染:1200 × 375 像素(108 dpi)
2.5× 渲染:2000 × 625 像素(180 dpi)
两个可搜索输出:800 × 250 pt
示例预期文字包括:Invoice 2026-0930 / Total USD 128.50常见问题
OCR 与文字层提取有什么区别?
OCR 识别渲染后的像素,可处理没有文字层的扫描件;已有可选文字也会栅格化,无需识别时应使用文字提取。
可搜索 PDF 保留什么?
保留按原物理显示尺寸生成的页面图像和新的隐藏 OCR 文字层;不保留原矢量、表单、注释、链接、书签或数字签名。
提高倍率会放大纸张吗?
不会。图像和隐藏文字同步缩放回原始物理显示尺寸,提高倍率只增加像素分辨率与内存使用。
有哪些语言和版面模式?
支持英文、简体中文或混合模型,以及自动版面、单文字块和稀疏文字。置信度只是 OCR 估计,姓名、数字和阅读顺序需要核对。
页码和输出有哪些限制?
输入最多 75 MiB、1000 源页;选定最多 40 页,每页 1600 万像素、合计 8000 万像素。PDF 输出最多 100 MiB,TXT/JSON 最多 8 MiB。无效范围会拒绝整个任务。
文件会上传或导出部分结果吗?
PDF 留在本地,仅下载引擎与语言包。失败或全部无文字时不生成完成导出;更换文件、选项或离开页面会撤销任务、Worker 和旧结果,下载需主动点击。
继续浏览