提取 PDF 文字
将 PDF 已有文字层导出为 TXT 或 JSON
渲染与提取
🔒 100% 本地运行 — 你的数据不会离开当前页面由 Evan 维护•最近更新:2026年9月30日
⏳加载工具中…
工具说明
本工具读取所选页面的现有文字层,不执行 OCR。TXT 按源文字项顺序与显式换行标志生成;JSON 还保留文字项原文、坐标、方向和页位置。它不还原视觉排版,多栏、旋转、连字及 PDF.js 空格规范化都可能影响阅读顺序。1-3,5 等严格页码范围会拒绝无效项,并按源页顺序去重。全部无文字时显示提示,不生成只有页标题的文本。CMap 或字体资源失败会停止处理。预览最多 16,000 个字符,明确点击下载的 TXT/JSON 保留完整有界结果。上限:20 MiB、200 页、4 MiB 提取文字、100,000 个文字项。
推荐工作流
场景配方
01
导出可选择的发票文字层
目标:将 PDF 已有文字层导出为 TXT 或 JSON
- 载入示例,输入页码范围 1。
- 提取文字,在预览中检查 Invoice 128.50。
- 下载 TXT 获取纯文字,或下载 JSON 获取页与文字项坐标。
结果:输出包含实际文字,不宣称 OCR,也不只有页标题。
失败门诊(高频踩坑)
可以识别扫描页面吗?
原因:不能。没有可用文字层的页面需先 OCR;空提取不会生成完成文本文件。
修复:扫描件应先用 PDF OCR 工具,再提取生成的可搜索文字层。
TXT 会保留视觉排版吗?
原因:不会。它保留 PDF.js 源文字项顺序与显式换行。多栏和旋转排版可参考 JSON 坐标或专门的排版流程。
修复:需要自定义阅读顺序时使用 JSON 中的文字项变换坐标,并人工检查旋转或多栏页。
生产可用片段
导出可选择的发票文字层
text
Range: 1
--- Page 1 ---
Invoice 128.50
Selectable sample text.常见问题
可以识别扫描页面吗?
不能。没有可用文字层的页面需先 OCR;空提取不会生成完成文本文件。
TXT 会保留视觉排版吗?
不会。它保留 PDF.js 源文字项顺序与显式换行。多栏和旋转排版可参考 JSON 坐标或专门的排版流程。
为什么部分有效的页码范围也报错?
每一项都必须是完整且未越界的页码或升序范围,不会静默忽略无效项。
继续浏览