OCR 识别结果错字、漏字怎么排查修复
更新于 2026-09-19 · DocsAll 办公指南
快速回答: OCR 错字漏字几乎都能归到六个原因:分辨率不足、页面倾斜、语言设置错误、字体特殊、背景干扰、缺少预处理。按"先看症状 → 定位原因 → 修输入"的顺序排查,比反复重跑有效得多。
症状 → 原因 → 修复
| 症状 | 最可能原因 | 修复 |
|---|---|---|
| 0 认成 O、1 认成 l | 分辨率低 | 换 300 DPI 以上扫描件 |
| 整行丢失 | 页面倾斜 | 纠偏后重识别 |
| 汉字变成偏旁部首 | 语言选错 | 语言设为"简体中文+英文" |
| 数字顺序对但值错 | 字形模糊 | 提高对比度、放大局部 |
| 全文都是乱码 | 编码/语言严重错配 | 确认文档语言,重选 |
| 部分区域没识别 | 印章/水印遮挡 | 遮挡区人工录入 |
排查步骤
- 先抽查 3 处:一段正文、一处数字、一处标题——确定错误是"普遍"还是"局部"。
- 普遍错误 → 检查语言设置(最常见翻车点)。
- 数字错 → 分辨率与对比度问题,换更清晰的源图。
- 个别字错 → 人工校对,别为几个字重跑全篇。
- 勾选灰度化预处理再试一次(DocsAll 图片 OCR 内置选项)。
修复不了的边界
- 潦草手写、印章压字、复印多代的模糊件——输入质量决定上限,重扫比调参快。
- DocsAll OCR 输出纯文本:不保留表格结构与排版,这类问题见表格指南。
常见问题
同一张图,为什么有的引擎识别好有的差? 各家模型对特定字体/语言的训练不同,重要文档建议两个引擎各跑一次对比。 错字率多少算正常? 没有统一标准——清晰印刷体通常 98%+,关键看你的校对成本能否接受。