Skip to content
DocsAll
教程

图片 OCR 文字识别:从图片中提取文字

Timi Tian · 发布于 2026年6月5日 · 更新于 2026年7月12日
图片OCR文字识别图片处理

图片 OCR 的常见需求

  • 截图里有文字想复制
  • 拍照的资料要转成可编辑文本
  • 图片里的表格要变成 Excel
  • 书籍扫描要数字化文字
  • 路牌、菜单拍照识别

手动打字又慢又错,OCR 一键提取,效率高几十倍。

OCR 的基本原理

OCR(光学字符识别)通过算法识别图片里文字的形状,转成对应的字符。现代 OCR 多用 AI 模型,识别率比传统算法高很多。

识别流程大致是:图像预处理 → 文字区域检测 → 字符识别 → 后处理校正。

影响识别精度的因素

图片清晰度

最关键。清晰大图识别率高,模糊小图识别率低。截图通常清晰,识别率高;拍照可能模糊或有阴影,识别率受影响。

文字大小

文字太小(几像素)识别困难。理想是文字高度 20 像素以上。太小先放大再识别。

背景对比度

文字和背景色对比越强越好。白底黑字最佳,浅灰底浅灰字识别困难。

字体

标准印刷体识别最好。手写体、艺术字、花体难度大。中英文混排、特殊符号也会降低精度。

排版

纯文本最易识别。表格、分栏、图文混排、旋转文字会增加难度。

提升识别精度的技巧

预处理图片

  • 放大小图:文字太小时先放大
  • 提高对比度:让文字和背景对比更明显
  • 去噪点:减少干扰
  • 纠正倾斜:歪斜的文字识别率低,先旋转校正
  • 二值化:转成黑白图,文字更突出

分区域识别

复杂版面分块识别,每块单独处理,比整图一次识别精度高。

选对识别语言

中英文混排选"中英文"模式,纯英文选"英文",避免语言设置错误导致乱码。

识别后校对

OCR 不可能 100% 准。识别后必校对,重点查:

  • 形近字(己已巳、0Oo、1lI)
  • 数字和字母(5 和 S、2 和 Z)
  • 标点符号
  • 专业术语

用 DocsAll 做 OCR

图片 OCR 工具 浏览器端处理:

  1. 上传图片
  2. 选择识别语言(中文、英文、中英混排)
  3. 运行识别
  4. 复制识别出的文字
  5. 校对修改

图片不上传服务器,敏感截图、证件照识别不泄露。

不同场景的识别技巧

截图识别

截图清晰度高,识别率最高。直接上传识别即可。

拍照识别

拍照可能有透视变形、阴影、反光。先做预处理:校正透视、调对比度、去阴影。

表格识别

表格 OCR 是难点,识别后表格结构常乱。简单表格能识别,复杂表格考虑用专门工具或手动整理。

手写体识别

手写体识别率低,工整手写还行,潦草手写基本认不出。重要手写内容还是人工录入更准。

证件识别

身份证、驾驶证等证件 OCR,注意隐私——用本地处理的工具,别上传到不明服务器。

常见问题

识别出乱码

语言选错或图片质量太差。换对语言,提升图片质量。

漏字

文字区域没全检测到,或部分文字模糊。手动补充漏识别的部分。

排版丢失

OCR 主要识别文字,排版格式(段落、缩进、对齐)常丢失。识别后手动调整排版。

公式、特殊符号

数学公式、特殊符号识别困难。这类内容识别后要仔细校对,或手动输入。

小结

图片 OCR 的核心是"图片质量决定上限,预处理和校对决定下限"。清晰高对比的图识别率最高,模糊低对比要先预处理。识别后必校对,重点查形近字和数字字母。DocsAll OCR 浏览器端跑,敏感图片不上传更安全。

T
Timi Tian 创始人 / 全栈工程师

DocsAll 创始人,10 年全栈开发经验,专注浏览器端文档处理技术与隐私保护架构。前新加坡科技公司技术负责人。