Skip to content
DocsAll

OCR 前的文档准备清单:五分钟准备换一倍识别质量

更新于 2026-09-19 · DocsAll 办公指南

快速回答: OCR 的质量在按下识别按钮之前就决定了。五分钟准备:确认分辨率 ≥300 DPI、页面端正、裁掉杂边、选对语言、单页试跑——这五步能把事后校对成本砍掉一半以上。

识别前清单(按顺序过一遍)

  1. 分辨率:扫描件 300 DPI 起;手机照片确认文字在屏幕上放大后边缘清晰。
  2. 端正:倾斜超过 2° 先纠偏(歪斜是整行丢失的头号原因)。
  3. 裁剪:去掉黑边、阴影、桌面背景——干扰区域越少,漏字越少。
  4. 语言:再次确认与文档实际语言一致;简繁混排选"简繁中文+英文"。
  5. 单页试跑:拿最差的一页先试——最差页能过,整批就能过。

文档状态分级

  • 原生 PDF:文字本来就是字符,跳过 OCR 直接复制。
  • 清晰扫描件:按清单走一遍即可识别。
  • 劣质扫描件:先看预处理指南(灰度/对比度补救或重扫)。

版面预检

  • 表格页:DocsAll OCR 输出纯文本不保留结构——表格页单独处理并预期手工重建(见表格指南)。
  • 双栏文档:识别输出按阅读顺序,双栏偶有交错,校对时重点检查栏间过渡处。
  • 印章/手写批注:这些区域识别不可靠,标记出来人工处理。

常见问题

直接全篇跑不行吗? 可以,但语言选错或质量翻车时整批作废;单页试跑的成本几乎为零。 准备比识别还慢? 大批量归档时准备是投资——每页省 3 分钟校对,100 页就是 5 小时。

相关指南

扫描件与 OCR 指南

扫描 PDF 转可编辑文字、中文 OCR 准确率提升的全部方法(含浏览器本地 OCR,敏感文件友好)。