Skip to content
DocsAll

日文、韩文、繁体中文扫描件 OCR 的语言设置与注意事项

更新于 2026-09-19 · DocsAll 办公指南

快速回答: DocsAll 的 PDF OCR 支持日文、韩文、繁体中文等 10+ 语言选项(基于 tesseract 语言包)。语言选择直接决定成败:日文文档选"日文+英文",繁体选"繁体中文+英文"——选错语言是 CJK 识别翻车的第一原因。

DocsAll 当前支持的语言选项

PDF OCR 语言选项:简体中文+英文、繁体中文+英文、简繁中文+英文、仅英文、仅简体中文、仅繁体中文、日文+英文、韩文+英文、法文、德文、西班牙文、俄文、阿拉伯文。

图片 OCR 当前支持:中英混合、英文、简体中文。

CJK 识别的特殊性

  • 字符集大:CJK 数千字符 vs 拉丁字母几十个,模型更难,出错形态也不同(形近字:日文里的"査/查")。
  • 混排常见:日文文档里汉字+假名+罗马字混排,选"日文+英文"组合而不是纯日文。
  • 繁简勿混:繁体文档选简体语言会大量错字;"简繁中文+英文"选项适合简繁混排。

注意事项

  • 语言支持 ≠ 完美识别:CJK 识别率受字体(明朝体/黑体差异大)、字号、扫描质量影响比英文更敏感。
  • DocsAll OCR 输出纯文本,不保留直排(竖排)结构——竖排文档识别后是逐行文字,顺序需要人工核对。
  • 片假名长音符号、全角半角混杂是日文 OCR 的典型错误点,校对时重点看。

常见问题

日文识别出错成中文? tesseract 的日文模型包含汉字,偶发把假名上下文中的汉字识别成中文简体形——确认语言选了"日文+英文"而不是"简体中文"。 韩文支持得怎么样? 韩文模型可用,但谚文+汉字混排的老文档识别率有限,重要文档逐段校对。

相关指南

扫描件与 OCR 指南

扫描 PDF 转可编辑文字、中文 OCR 准确率提升的全部方法(含浏览器本地 OCR,敏感文件友好)。