OCR(光学文字認識)は、スキャンしたページを選択、コピー、検索可能なテキストに変換します。Paper Scan は Apple と Google のオンデバイス ML キットを使って OCR を完全に端末上で実行するため、認識のためにスキャン内容が外部サーバーに送信されることはありません。認識されたページはローカルライブラリにインデックスされ、保存した瞬間に検索対象になります。
OCR が解放するもの
ページが認識されると、以下のことが可能になります:
- スキャンからテキストをコピーする。 任意の単語を長押しすると、ページ全体を覆う選択オーバーレイが表示されます。選択したテキストは他のアプリにペーストできます。
- スキャン内を検索する。 ドキュメントリスト上部の検索バーは、タイトルやタグだけでなく、全ページの認識テキストも照会します。電話番号、名前、請求番号、住所をライブラリ全体から探し出せます。
- 引用・参照する。 スキャンした領収書、契約書、手書きのメモ、ホワイトボードのキャプチャはすべて、後から参照可能な引用可能なテキストになります。
オンデバイス処理が重要な理由
- プライバシー。 スキャン内容が認識のために端末を離れることはありません。請求書、契約書、医療フォーム、個人データを含むあらゆる文書に関係します。
- 低遅延。 ネットワークのラウンドトリップがありません。最近の iPhone やハイエンド Android では、標準的な1 ページの OCR は通常 1 秒以内に完了します。
- オフラインで利用可能。 機内、地下室、ネットワーク圏外でも OCR は動作します。接続は一切不要です。
精度はサーバーベースの OCR サービスと同等で、違いは計算がどこで動くかだけです。
認識精度を高めるベストプラクティス
OCR の精度は主に入力品質に依存します。重要度順に 3 つの要因:
- 照明。 窓からの均等な間接光は、頭上の単一スポットライトより優れます。ページにかかる影が誤読の最も一般的な原因です。
- ピント。 オートフォーカスが誤った被写体を選んだ場合、撮影前にテキストの中心をタップしてください。ぼやけたスキャンは使えるスキャンには rarely なりません。
- フィルター選択。 白黒は印刷フォームの最もクリーンなテキストを提供します。マジックカラーはインクが薄れた場合や紙が黄ばんだ場合に推奨されます。自動はほとんどの日常的なケースを処理します。
- 平坦なページ。 綴じ目に向かって湾曲したページは、のどに近い文字を失います。可能であれば反対の手でページを押さえて平らにしてください。
- 言語ヒント。 単一言語のページには OCR 言語を明示的に設定してください。複数文字種が混在するページは、ヒントなしで 1 回のパスで処理されます。
精度の限界
OCR は印刷されたテキストに対しては高い精度(95%+)を発揮しますが、手書きの筆記体、非常に小さなフォント、装飾的なフォント、光沢のある雑誌の反射、インクが物理的に薄れた古い領収書などでは信頼性が低くなります。元の画像は常に利用可能です:重要なページで OCR が失敗しても、スキャン本身を読むことができます。
無料プランには、日常の領収書、名刺、時折の本章には十分な 1 日あたりの OCR 許容量があります。Pro は 1 日上限を撤回し、フォルダ全体を 1 回の操作で OCR する機能を追加します。
オンデバイスエンジンはラテン文字(英語、フランス語、ドイツ語、スペイン語、ポルトガル語、イタリア語など)、中国語(簡体字・繁体字)、日本語、韓国語、ほとんどのヨーロッパ文字をサポートします。複数文字種が混在するページは 1 回の認識パスで処理されます。