# PDF 文本提取 https://thedollscout.com/zh/pdf-to-text 由 TDS 文档侦察站发布 更新日期: 2026-09-25 适用场景: 需要复用 PDF 已有文字,或先判断能否提取文本时。 你会得到: 按页分组的可提取文字,以及保存在本地的 TXT 文件。 仍需确认: 纯图片页面需要另外使用 OCR;提取的文字顺序也可能需要修正。 在当前浏览器中处理,无需上传文件或注册。 这是发布前的检查,不是 WCAG 或 PDF/UA 认证。检测到标签或标题,并不证明其内容正确。 使用 Mozilla PDF.js 解析真实的 PDF 对象,检查标题、语言声明、已标记声明、页面文字、可暴露的结构角色和表单字段。 缺失声明和结构属于处理线索。标题跳级、表格、表单和缺少书签的长文档需要人工判断,不计算百分比无障碍评分。 每份文件最多 20 MB,每批最多 10 份且总计 100 MB。每份检查至多 200 页,每批至多 600 页。文本上限为每页 10 万字元、每份 200 万字元;部分结果会明确标记。 版本对比用规范化文本对齐页面。文本相同不代表图片、标签、链接或版式相同。没有可用文本的页面保留为未知。 报告在本地生成。人工勾选仅记录使用者的判断,不是独立审计。原始文件不会被改写。 PDF 会离开我的设备吗? 不会。文件解析、文本提取和版本比较都在浏览器中完成。导出的报告可能包含文件名和标题,请自行选择安全的分享方式。 没有发现问题就代表无障碍合格吗? 不代表。这里的检查用于安排处理工作。阅读顺序、图片含义、表格、表单及辅助技术中的表现仍需复核。 能修复扫描件或补齐标签吗? 当前版本检查文档并提取已有文本,不执行 OCR、不添加标签,也不修复原始 PDF。请使用合适的编辑或修复工具处理后,再检查导出的文件。 参考资料 - W3C: PDF reading order: https://www.w3.org/WAI/WCAG22/Techniques/pdf/PDF3 - W3C: text alternatives in PDF: https://www.w3.org/WAI/WCAG22/Techniques/pdf/PDF1 - Mozilla PDF.js: https://mozilla.github.io/pdf.js/