扫描件还是文本 PDF:下一步怎么处理

由 TDS 文档侦察站发布 · 更新日期

PDF 可以包含真实文字、页面图片,或二者混合。看得见文字,不代表程序能提取或辅助技术能读取。

先提取一页文字。结果为空时查看原页,判断它是扫描图、空白页还是不支持的内容。空结果本身不能证明是扫描件。

扫描件可用合适的 OCR 工具处理,再逐项核对人名、数字、标点和阅读顺序。识别出的文字也可能出错。

文本层只是第一步,标题结构和替代文本仍需单独检查。本工具不执行 OCR,也不认证处理后的 PDF。

PDF 文本提取

参考资料

弄清楚下一步怎么做

也让需要的人少走一步。

把工具或指南分享给同事。对方打开的是公开页面,工作区为空。