纸质合同要录入系统、截图里的文字不能复制、扫描件要提取内容——打字打到手酸,不如直接让软件认字。WPS 图片的文字识别(OCR)功能,能把图片里的文字提取成可编辑的文本,准确率日常够用。这篇讲它的用法和适用范围。

OCR 能做什么、不能做什么
OCR 擅长处理“印刷体文字”:打印的文档、网页截图、扫描件、拍得端正的印刷品,识别准确率高。它不太擅长:手写体(尤其潦草的)、歪斜严重的照片、艺术字和特殊字体。先想清楚素材类型,再决定值不值得用 OCR,避免浪费时间。
用 WPS 图片识别文字的步骤
用 WPS 图片打开图片,点工具栏的“文字识别”或“OCR”,软件自动框出文字区域并识别。识别结果可以复制、导出为文本或 Word。操作很简单,重点在识别前的准备:图片越清晰、文字越正、光线越均匀,识别率越高。
提高识别率的四个技巧
- 拍照时镜头正对纸面,别斜拍;
- 光线均匀,避免阴影盖住文字;
- 模糊的图片先锐化再识别,方法看WPS图片锐化与降噪;
- 扫描件分辨率别太低,300dpi 以上为宜。
识别结果必须人工复核
OCR 的错字很隐蔽:同音字、形近字、数字串错位。提取出来的文本,重点核对四类内容:金额和数字、人名地名、身份证号手机号、专业术语。识别长文档时,逐段核对或分段识别,别指望“一键全对”。关键合同和证件,宁可打字也别赌识别率。
OCR 之后的处理流程
识别出文本后,常规流程:复制到 WPS 文字里,按原文档结构排版,再做内容核对。图片里的表格,有些 OCR 工具能识别表格结构,但复杂表格建议手动重建。识别文字配合文档排版,可以看WPS文档排版全攻略,更多图片技巧在WPS图片处理栏目。
1 条评论
评论已关闭。