1Muatkan naik PDF documents yang diimbas; imbasan skala kelabu 300 DPI bersih memberikan pengiktirafan yang paling banyak untuk bekerja.
2Beritahu bahasa mana yang hendak diharapkan — nama bahasa melebihi biarkan ia meneka dengan margin yang luas.
3Jalankan laluan pengenalan; perkataan ditulis semula sebagai lapisan tak kelihatan duduk di atas imej halaman asal.
4Muat turun fail bolehcari PDF — ia kelihatan sama, tetapi anda boleh cari dan pilih teks didalamnya.
PDF OCR Soalan Lazim
Bahasa apa yang ia boleh mengenali?
+
Lebih 100, termasuk Latin, Cyrillic, Greek, Arab, Hebrew, Cina, Jepun, Korea dan skrip India. Memaklumkan bahasa mana yang dijangkakan secara material meningkatkan ketepatan berbanding membiarkan ia meneka.
Berapa tepatnya?
+
Pada imbasan 300 DPI bersih teks cetak, cukup tinggi untuk ralat jarang berlaku dan kebanyakannya dalam nama benda yang tidak biasa. Ketepatan jatuh dengan jelas dengan resolusi rendah, lengkung, bayang dari kamera telefon, font yang tidak biasa dan tulisan tangan — tulisan tangan khususnya bukanlah apa yang ini untuk.
Apa yang patut saya imbas untuk hasil yang terbaik?
+
300 DPI dalam skala kelabu adalah titik manis. Di bawah 200 DPI bentuk aksara mula rosak; di atas 400 DPI anda tidak mendapat apa-apa dan membayar untuknya dalam saiz fail dan masa pemprosesan.
Bagaimana OCR PDF menukar imbasan ke teks?
+
Secara khusus, setiap halaman dihasilkan, berjalan melalui laluan pengenalan teks Tesseract, dan perkataan yang dikenali ditulis semula sebagai lapisan teks tak kelihatan diletakkan di atas imej asal — jadi halaman kelihatan tidak berubah tetapi boleh dicari dan dipilih. Halaman masih kelihatan seperti yang ia lakukan - teks yang dikenali duduk tidak kelihatan di belakang imej jadi carian dan pemilihan bekerja tanpa mengubah penampilan.
Bolehkah saya jalankan OCR PDF pada beberapa PDF documents sekaligus?
+
Ya — muat naik set dan mereka diproses secara serentak di bawah satu set tetapan, yang merupakan titik untuk melakukan aliran kerja dokumen di sini daripada mengklik melalui pembaca desktop.
Adakah OCR PDF memerlukan bayaran?
+
No. OCR PDF adalah bebas tanpa akaun, dan tiada apa yang ditempel pada halaman. Dokumen yang dimuat naik dipadam dari pekerja tidak lama selepas tugas selesai.
Apa yang boleh saya muat naik ke OCR PDF?
+
Sebarang PDF piawai, termasuk yang dihasilkan oleh pengimbas, pemproses kata atau pemacu cetakan. Fail dengan kata laluan pemilik yang hanya membatasi penyuntingan diurus; fail yang memerlukan kata laluan pengguna untuk dibuka tidak, dan kami tidak cuba memecah penyulitan.
Adakah OCR PDF akan menurunkan kualiti PDF documents saya?
+
Teks dan karya seni vektor adalah objek bukan piksel, jadi mereka tetap tajam pada sebarang zum tanpa mengira apa yang berlaku. Hanya imej raster terbenam boleh diturunkan, dan hanya jika operasi yang anda pilih menguji semula mereka.
Adakah OCR PDF berada pada laman mengenai format foto?
+
JPEG.to dibina di sekeliling format yang membawa hampir setiap foto dalam wujud - tiga puluh tahun, dibuka oleh literally segala-galanya, dan masih default yang betul untuk imej fotografi. Kerja yang orang bawa ke sini adalah yang dikumpulkan oleh foto sepanjang hayatnya — terlalu besar untuk emel, dimensi salah untuk bentuk, cara salah untuk keluar dari telefon. OCR PDF berjalan pada muat naik yang sama dan akaun yang sama seperti penukaran kerana di situlah kerja-kerja itu dimuatkan.
Apakah langkah seterusnya yang masuk akal selepas OCR PDF?
+
Penukar pada laman ini memindahkan imej ke dan dari JPEG, PNG, WebP dan HEIC, yang mana adalah di mana perdagangan antara saiz fail dan satu generasi kehilangan lagi diputuskan. Menetapkan format terakhir bukannya pertama adalah titik utama: setiap simpanan tambahan imej fotografi adalah generasi lain, dan semakin kurang daripadanya anda belanjakan, semakin banyak gambar yang bertahan.
Adakah ini enjin yang sama seperti laman web penukar lain?
+
Ya — pustaka yang sama, pekerja yang sama, huruf besar yang sama. Perbezaan ialah nasihat yang mana pada halaman, dan di sini nasihat itu dibina pada satu sifat format yang laman dinamakan selepas: sambungan.jpeg dan.jpg adalah bitstrim yang sama, jadi tiada apa di sini berperilaku berbeza daripada.jpg — hanya nama fail berubah.
Ada apa-apa yang disimpan, dan adakah saya perlu mendaftar masuk?
+
Tiada apa- apa yang disimpan dan tiada akaun diperlukan. Muat naik dibuang dari pekerja tidak lama selepas kerja selesai; tiada apa- apa yang dilihat, disenaraikan atau diindeks. Akaun membeli sejarah dan lombong yang lebih besar, bukan akses.