OCR di perangkat: teks yang dapat dicari dari setiap halaman yang dipindai

Last updated: 2026-09-02

OCR (pengenalan karakter optik) mengubah halaman yang dipindai menjadi teks yang dapat dipilih, disalin, dan dicari. Paper Scan menjalankan OCR sepenuhnya di perangkat menggunakan ML kit Apple dan Google, sehingga tidak ada konten pinyang yang dikirim ke server eksternal untuk pengenalan. Halaman yang dikenali diindeks dalam pustaka lokal dan dapat dicari segera setelah disimpan.

Apa yang dibuka OCR

Setelah halaman dikenali:

Mengapa pemrosesan di perangkat penting

Akurasi sebanding dengan layanan OCR berbasis server; yang berbeda adalah tempat komputasi berjalan.

Praktik terbaik untuk pengenalan yang akurat

Akurasi OCR bergantung terutama pada kualitas input. Tiga faktor, dalam urutan kepentingan:

  1. Pencahayaan. Cahaya tidak langsung yang merata dari jendela berkinerja lebih baik daripada satu lampu sorot di atas. Bayangan yang melewati halaman adalah penyebab paling umum dari karakter yang salah dibaca.
  2. Fokus. Jika fokus otomatis memilih subjek yang salah, ketuk bagian teks di tengah sebelum pengambilan. Pindaian yang buram jarang merupakan pindaian yang dapat digunakan.
  3. Pemilihan filter. Hitam putih memberikan teks paling bersih untuk formulir cetak. Warna ajaib direkomendasikan ketika tinta sudah pudar atau kertas sudah menguning. Otomatis menangani sebagian besar kasus sehari-hari.
  4. Halaman datar. Halaman yang melengkung ke arah tulang punggung kehilangan karakter di dekat alur. Tekan halaman datar dengan tangan lain jika memungkinkan.
  5. Petunjuk bahasa. Atur bahasa OCR secara eksplisit untuk halaman berbahasa tunggal. Halaman skrip campuran diproses dalam satu lintasan tanpa petunjuk.

Keterbatasan akurasi

OCR bekerja dengan baik pada teks cetak (akurasi 95%+) tetapi kurang dapat diandalkan untuk tulisan tangan cursive, font yang sangat kecil, font dekoratif bergaya, pantulan majalah mengkilap, dan tanda terima lama di mana tinta sudah pudar secara fisik. Gambar asli tetap tersedia dalam semua kasus: jika OCR gagal pada halaman kritis, pindaian itu sendiri masih dapat dibaca.

Tingkat gratis termasuk jatah OCR harian yang cukup untuk tanda terima sehari-hari, kartu nama, dan bab buku sesekali. Pro menghapus batas harian dan menambahkan kemampuan untuk OCR seluruh folder dalam satu operasi.

Mesin di perangkat mendukung skrip Latin (bahasa Inggris, Prancis, Jerman, Spanyol, Portugis, Italia, dan lain-lain), bahasa Mandarin (sederhana dan tradisional), Jepang, Korea, dan sebagian besar skrip Eropa. Halaman skrip campuran ditangani dalam satu lintasan pengenalan.