UTILS.
100% trong trình duyệt

Trích xuất văn bản từ PDF

Lấy toàn bộ văn bản có thể chọn trong PDF ra thành văn bản thuần để sao chép hoặc tải về — không tải lên.

Công cụ tải engine khi dùng lần đầu nên không có bản tải về để chạy ngoại tuyến — nhưng nó vẫn chạy riêng tư trong trình duyệt của bạn, không tải gì lên máy chủ.

Kéo file PDF vào đây, hoặc nhấp để chọn file

Về công cụ này

Trích xuất lớp văn bản của một file PDF thành văn bản thuần sạch, có thể sao chép. Thả một file vào và mọi trang được đọc theo thứ tự, có dấu phân trang giữa các trang, rồi bạn có thể sao chép kết quả vào bộ nhớ tạm hoặc tải về dưới dạng file .txt.

Mọi thứ chạy cục bộ trong trình duyệt của bạn — tài liệu không bao giờ rời khỏi thiết bị và không có gì được lưu ở đâu cả. Điều đó khiến nó an toàn cho hợp đồng, hóa đơn, sao kê và các file nhạy cảm khác.

Lưu ý rằng công cụ này đọc lớp văn bản nhúng mà một trình xem PDF cho phép bạn chọn và sao chép. Tài liệu quét chỉ là những bức ảnh chụp các trang mà không có lớp văn bản, nên chúng sẽ ra rỗng — với những file đó, hãy dùng công cụ OCR để nhận dạng ký tự.

Câu hỏi thường gặp

Tại sao file PDF của tôi không ra được văn bản nào?
Nhiều khả năng đó là tài liệu quét: các trang là ảnh không có lớp văn bản chọn được. Công cụ này không thực hiện OCR — hãy chạy các trang qua công cụ Image OCR trên trang này để nhận dạng văn bản đã quét.
File PDF có được tải lên máy chủ không?
Không. Văn bản được trích xuất bằng một công cụ PDF chạy hoàn toàn trong tab trình duyệt của bạn, nên file không bao giờ rời khỏi thiết bị — an toàn cho tài liệu bảo mật.
Nó có giữ nguyên bố cục gốc không?
Ngắt dòng được giữ lại ở nơi PDF đánh dấu, nhưng cột, bảng và khoảng cách chính xác bị làm phẳng theo thứ tự đọc — PDF là định dạng in ấn, nên không phải lúc nào cũng khôi phục hoàn hảo được bố cục.
Tôi có thể chỉ trích xuất một số trang không?
Công cụ trích xuất mọi trang và chèn dấu phân cách "Page N" giữa chúng, nên bạn có thể nhanh chóng tìm và sao chép đúng phần bạn cần từ ô kết quả.

Công cụ khác