裝置端 OCR:讓每一頁掃描都可搜尋
OCR(光學字元辨識)將掃描頁面轉換成可選取、可複製、可搜尋的文字。Paper Scan 完全在裝置上執行 OCR,使用 Apple 和 Google 的端側 ML Kit,因此任何掃描內容都不會被傳送到外部伺服器進行辨識。辨識後的頁面會在本地資料庫建立索引,儲存的瞬間即可搜尋。
OCR 帶來的能力
頁面辨識完成後:
- 從掃描複製文字。 長按任一單字會叫出覆蓋整頁的選取浮層。選取的文字可貼到任何其他應用程式。
- 在掃描內搜尋。 文件清單頂端的搜尋列會查詢每一頁辨識後的文字,而非僅標題和標籤。電話號碼、姓名、發票號碼和地址可在整個資料庫中定位。
- 引用與參考。 掃描的發票、合約、手寫筆記和拍照白板都變成可引用的文字,稍後可供參考。
為何裝置端處理很重要
- 隱私。 掃描內容從不離開裝置進行辨識。這關係到發票、合約、醫療表單和任何包含個人資料的文件。
- 低延遲。 沒有網路往返。在最新的 iPhone 和旗艦 Android 裝置上,標準頁面的 OCR 通常在一秒內完成。
- 離線可用。 OCR 在飛機上、地下室以及沒有網路覆蓋的地方都能運作。不需要連線。
準確率與基於伺服器的 OCR 服務相當;差別在於計算執行的位置。
準確辨識的最佳實務
OCR 準確率主要取決於輸入品質。按重要性排序的三個因素:
- 照明。 來自窗戶的均勻間接光比頭頂聚光燈效果更好。跨越頁面的陰影是誤讀字元的最常見原因。
- 對焦。 如果自動對焦選錯目標,請在拍攝前點選文字中央。模糊的掃描幾乎無法使用。
- 濾鏡選擇。 黑白為印刷表格提供最干净的文字。當墨水褪色或紙張發黃時,建議使用「魔法色彩」。Auto 適合大多數日常場景。
- 頁面平整。 向書脊彎曲的頁面會在裝訂線附近遺失字元。盡量用另一隻手將頁面壓平。
- 語言提示。 為單語言頁面(例如中文)明確設定 OCR 語言。混合文字頁面可在單次處理中辨識,無需提示。
準確率限制
OCR 在印刷文字上表現良好(準確率 95%+),但在以下情況可靠性較低:
- 手寫草書,特別是非拉丁文字。手寫辨識準確率通常在 60-80% 之間,取決於書寫者。
- 極小字體——註腳、細小印刷、零件編號。
- 裝飾性字體,字元形狀不標準。
- 光面雜誌,反光干擾字元辨識。
- 老舊發票,墨水已經物理褪色。
所有情況下,原始影像都保留可用。如果 OCR 在關鍵頁面失敗,掃描本身仍可閱讀。
免費版與 Pro
免費版包含每日 OCR 額度——通常足以應付日常發票、名片和偶爾的書籍章節。Pro 取消了每日上限,並增加在單次操作中對整個資料夾執行 OCR 的能力。對於有積壓未辨識掃描的資料庫,Pro 提供了最高效的批次處理方式。
支援的語言
裝置端引擎支援拉丁文字(英文、法文、德文、西班牙文、葡萄牙文、義大利文等)、中文(簡體和繁体)、日文、韓文以及大多數歐洲文字。混合文字頁面在單次辨識中處理。