Kế hoạch miễn phí: 1 chuyển đổi/ giờ, 1 tập tin mỗi lần
Không giới hạn →

OCR PDF

PDF Nhận dạng văn bản

Chọn tập tin của bạn

*Các tệp bị xóa sau 24 giờ

Chuyển đổi miễn phí các tập tin có dung lượng lên đến 1 GB, người dùng Pro có thể chuyển đổi các tập tin lên đến 100 GB; Đăng ký ngay!

Đang tải lên

0%

Cách OCR PDF

1 Tải lên PDF documents đã quét; một bản quét màu xám 300 DPI sạch sẽ cho phép người nhận diện làm việc nhiều nhất.
2 Nói cho nó biết ngôn ngữ nào để mong đợi — đặt tên ngôn ngữ đánh bại để nó đoán trước một khoảng cách rộng.
3 Chạy quá trình nhận dạng; các từ được viết lại như một lớp vô hình nằm trên hình ảnh trang gốc.
4 Tải về tập tin PDF có thể tìm kiếm — nó trông giống nhau, nhưng bây giờ bạn có thể tìm kiếm và chọn văn bản trong nó.

OCR PDF Câu hỏi thường gặp

Nó có thể nhận ra ngôn ngữ nào?
+
Hơn 100, bao gồm Latin, Cyrillic, Greek, Arabic, Hebrew, Chinese, Japanese, Korean và Indian scripts. Nói cho nó biết ngôn ngữ nào để mong đợi sẽ cải thiện chính xác hơn là để nó đoán.
Trong một bản scan văn bản in sạch 300 DPI, độ cao đủ cao để các lỗi hiếm gặp và hầu hết là trong các danh từ chính bất thường. Độ chính xác giảm mạnh với độ phân giải thấp, lệch, bóng tối từ máy ảnh điện thoại, phông chữ bất thường và chữ viết tay — đặc biệt là chữ viết tay không phải là mục đích của công cụ này.
300 DPI trong độ xám là điểm tốt nhất. Dưới 200 DPI, hình dạng ký tự bắt đầu bị phá vỡ; trên 400 DPI, bạn hầu như không có gì cả và phải trả giá bằng kích thước tập tin và thời gian xử lý.
Concretely, mỗi trang được vẽ, chạy qua một bước nhận dạng văn bản Tesseract, và các từ được nhận dạng được viết lại như một lớp văn bản vô hình được đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
Có — tải lên tập tin và chúng sẽ xử lý song song dưới một tập hợp các cài đặt, đó là điểm của việc làm một luồng tài liệu ở đây thay vì click qua một trình đọc desktop.
Số OCR PDF là miễn phí nếu không có tài khoản, và không có gì được dán dấu lên các trang. Tài liệu tải lên sẽ bị xóa khỏi người làm việc ngay sau khi công việc hoàn thành.
Mọi PDF tiêu chuẩn, bao gồm những tập tin được tạo bởi máy quét, trình xử lý văn bản hay trình điều khiển in. Tập tin có mật khẩu chủ chỉ hạn chế sửa đổi sẽ được xử lý; tập tin cần mật khẩu người dùng để mở không được xử lý, và chúng tôi không cố gắng phá mã hóa.
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo khi phóng to bất kỳ dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
JPEG.to được xây dựng xung quanh định dạng mang hầu hết mọi bức ảnh tồn tại - ba mươi năm tuổi, mở bởi tất cả mọi thứ, và vẫn là mặc định đúng cho một hình ảnh nhiếp ảnh. Những công việc mà người ta mang đến đây là những gì một bức ảnh thu thập trong suốt cuộc đời của nó - quá lớn để gửi email, kích thước sai cho một mẫu, sai cách ra khỏi điện thoại. OCR PDF chạy trên cùng một tải lên và cùng một tài khoản như các chuyển đổi vì đó là nơi những công việc đó hạ cánh.
Thiết bị chuyển đổi trên trang web này chuyển ảnh từ và sang JPEG, PNG, WebP và HEIC, đây là nơi giao dịch giữa kích thước tập tin và một thế hệ mất mát khác được giải quyết. Quyết định định dạng cuối cùng thay vì đầu tiên là toàn bộ điểm: mỗi lần lưu thêm một hình ảnh nhiếp ảnh là một thế hệ khác, và càng ít bạn tiêu tốn, càng nhiều bức ảnh tồn tại.
Có — cùng thư viện, cùng người làm việc, cùng chữ cái. Sự khác biệt là lời khuyên nào trên trang, và ở đây lời khuyên đó được xây dựng trên một thuộc tính của định dạng mà trang web được đặt tên theo: các phần mở rộng.jpeg và.jpg là cùng một dòng bit, vì vậy không có gì ở đây khác với.jpg — chỉ có tên tập tin thay đổi.
Không có gì được giữ và không cần tài khoản nào cả. Các tải lên sẽ bị gỡ bỏ khỏi người làm việc ngay sau khi công việc kết thúc; không có gì được xem, liệt kê hay chỉ mục. Một tài khoản mua lịch sử và các gói lớn hơn, không phải truy cập.

Đánh giá công cụ này
5.0/5 - 0 phiếu bầu
Nhà xuất bản NXB.com. - Mua tên miền từ $2/năm. Trên mạng trong vài phút.
Hoặc tải tệp của bạn lên đây