本地 OCR:让每一页扫描件都可搜索
OCR(光学字符识别)将扫描页面转换为可选、可复制、可搜索的文本。Paper Scan 完全在设备上运行 OCR,使用 Apple 和 Google 的端侧 ML Kit,因此任何扫描内容都不会被发送到外部服务器进行识别。识别后的页面会在本地库中建立索引,保存的瞬间即可搜索。
OCR 带来的能力
页面识别完成后:
- 从扫描件复制文本。 长按任意单词会唤起覆盖整页的选择浮层。选中的文本可以粘贴到任何其他应用。
- 在扫描件内搜索。 文档列表顶部的搜索栏会查询每一页识别后的文本,而不仅是标题和标签。电话号码、姓名、发票号码和地址可以在整个库中定位。
- 引用与参考。 扫描的发票、合同、手写笔记和拍照白板都变成可引用的文本,稍后可供参考。
为什么端侧处理很重要
- 隐私。 扫描内容从不离开设备进行识别。这关系到发票、合同、医疗表单和任何包含个人数据的文档。
- 低延迟。 没有网络往返。在最近的 iPhone 和旗舰 Android 设备上,标准页面的 OCR 通常在一秒内完成。
- 离线可用。 OCR 在飞机上、地下室里以及没有网络覆盖的地方都能工作。不需要连接。
准确率与基于服务器的 OCR 服务相当;区别在于计算运行的位置。
准确识别的最佳实践
OCR 准确率主要取决于输入质量。按重要性排序的三个因素:
- 光照。 来自窗户的均匀间接光比头顶聚光灯效果更好。跨越页面的阴影是误读字符的最常见原因。
- 聚焦。 如果自动对焦选错目标,在拍摄前点击文本中央。模糊的扫描几乎无法使用。
- 滤镜选择。 黑白为印刷表格提供最干净的文本。当墨水褪色或纸张发黄时,推荐使用「魔法色彩」。Auto 适合大多数日常场景。
- 页面平整。 向书脊弯曲的页面会在装订线附近丢失字符。尽量用另一只手把页面压平。
- 语言提示。 为单语言页面(例如中文)显式设置 OCR 语言。混排脚本可在单次中中处理识别,无需提示。
准确率限制
OCR 在印刷文本上表现良好(准确率 95%+),但在以下情况可靠性较低:
- 手写草书,特别是非拉丁文字。手写识别的准确率通常在 60-80% 之间,取决于书写者。
- 极小字体——脚注、小字印刷、零件号。
- 装饰性字体,字符形状不标准。
- 光面杂志,反射干扰字符识别。
- 老旧发票,墨水已经物理褪色。
在所有情况下,原始图像都保留可用。如果 OCR 在关键页面上失败,扫描件本身仍可阅读。
免费版与 Pro
免费版包含每日 OCR 额度——通常足以应付日常发票、名片和偶尔的书籍章节。Pro 取消了每日上限,并增加了在单次操作中对整个文件夹运行 OCR 的能力。对于有积压未识别扫描的库,Pro 提供了最高效的批量处理方式。
支持的语言
端侧引擎支持拉丁文字(英语、法语、德语、西班牙语、葡萄牙语、意大利语等)、中文(简体和繁体)、日语、韩语以及大多数欧洲文字。混排页面在单次识别中处理。