OCR 前的文档准备清单:五分钟准备换一倍识别质量
更新于 2026-09-19 · DocsAll 办公指南
快速回答: OCR 的质量在按下识别按钮之前就决定了。五分钟准备:确认分辨率 ≥300 DPI、页面端正、裁掉杂边、选对语言、单页试跑——这五步能把事后校对成本砍掉一半以上。
识别前清单(按顺序过一遍)
- 分辨率:扫描件 300 DPI 起;手机照片确认文字在屏幕上放大后边缘清晰。
- 端正:倾斜超过 2° 先纠偏(歪斜是整行丢失的头号原因)。
- 裁剪:去掉黑边、阴影、桌面背景——干扰区域越少,漏字越少。
- 语言:再次确认与文档实际语言一致;简繁混排选"简繁中文+英文"。
- 单页试跑:拿最差的一页先试——最差页能过,整批就能过。
文档状态分级
- 原生 PDF:文字本来就是字符,跳过 OCR 直接复制。
- 清晰扫描件:按清单走一遍即可识别。
- 劣质扫描件:先看预处理指南(灰度/对比度补救或重扫)。
版面预检
- 表格页:DocsAll OCR 输出纯文本不保留结构——表格页单独处理并预期手工重建(见表格指南)。
- 双栏文档:识别输出按阅读顺序,双栏偶有交错,校对时重点检查栏间过渡处。
- 印章/手写批注:这些区域识别不可靠,标记出来人工处理。
常见问题
直接全篇跑不行吗? 可以,但语言选错或质量翻车时整批作废;单页试跑的成本几乎为零。 准备比识别还慢? 大批量归档时准备是投资——每页省 3 分钟校对,100 页就是 5 小时。