Skip to content
DocsAll

发票、收据、合同扫描件 OCR:单据场景的做法与校对重点

更新于 2026-09-19 · DocsAll 办公指南

快速回答: 单据 OCR 的目标是把关键字段(日期、金额、编号)从照片里取出来,替代手工录入。诚实边界:DocsAll OCR 输出纯文本,不做字段级结构化提取(不会自动分出"金额=xxx")——识别后靠查找定位关键字段并人工核对。

单据场景的正确流程

  1. 拍清楚:发票平铺、光线均匀、四角完整;热敏小票(超市收据)字迹浅,拍完立即检查是否清晰。
  2. 单张识别:用图片 OCR 逐张处理,语言选"简体中文+英文"。
  3. 定位关键字段:在结果文本里查找 ¥、¥、日期格式、发票号等锚点。
  4. 逐项核对:金额和日期是 OCR 错误率最高、后果也最重的字段。

各类单据的校对重点

  • 增值税发票:发票号、税号(数字长串,0/O 混淆高发)、金额大小写。
  • 超市收据:热敏纸褪色是识别大敌;小票纸发黄发淡后基本救不回,重要小票拍照存档。
  • 合同:金额、日期、签署人姓名;合同页数多时用 PDF OCR 按页码范围识别关键页。

为什么不建议全靠自动

财务场景对准确率的要求是 100%,而 OCR 的实际错率在关键数字上不可忽略——OCR 负责省去 90% 的打字量,人负责 100% 的正确性。字段级自动提取(结构化发票识别)是另一类专门产品,DocsAll 当前不具备。

常见问题

能批量识别一堆发票吗? 逐张处理图片 OCR;批量 PDF 见批量处理指南。识别结果按文件名对应归档。 表格式的报销单怎么处理? 表格结构不会被保留(见表格指南),按行识别后手工录入到报销系统。

相关指南

扫描件与 OCR 指南

扫描 PDF 转可编辑文字、中文 OCR 准确率提升的全部方法(含浏览器本地 OCR,敏感文件友好)。