发票、收据、合同扫描件 OCR:单据场景的做法与校对重点
更新于 2026-09-19 · DocsAll 办公指南
快速回答: 单据 OCR 的目标是把关键字段(日期、金额、编号)从照片里取出来,替代手工录入。诚实边界:DocsAll OCR 输出纯文本,不做字段级结构化提取(不会自动分出"金额=xxx")——识别后靠查找定位关键字段并人工核对。
单据场景的正确流程
- 拍清楚:发票平铺、光线均匀、四角完整;热敏小票(超市收据)字迹浅,拍完立即检查是否清晰。
- 单张识别:用图片 OCR 逐张处理,语言选"简体中文+英文"。
- 定位关键字段:在结果文本里查找 ¥、¥、日期格式、发票号等锚点。
- 逐项核对:金额和日期是 OCR 错误率最高、后果也最重的字段。
各类单据的校对重点
- 增值税发票:发票号、税号(数字长串,0/O 混淆高发)、金额大小写。
- 超市收据:热敏纸褪色是识别大敌;小票纸发黄发淡后基本救不回,重要小票拍照存档。
- 合同:金额、日期、签署人姓名;合同页数多时用 PDF OCR 按页码范围识别关键页。
为什么不建议全靠自动
财务场景对准确率的要求是 100%,而 OCR 的实际错率在关键数字上不可忽略——OCR 负责省去 90% 的打字量,人负责 100% 的正确性。字段级自动提取(结构化发票识别)是另一类专门产品,DocsAll 当前不具备。
常见问题
能批量识别一堆发票吗? 逐张处理图片 OCR;批量 PDF 见批量处理指南。识别结果按文件名对应归档。 表格式的报销单怎么处理? 表格结构不会被保留(见表格指南),按行识别后手工录入到报销系统。