Cách chuyển ảnh chụp tài liệu thành văn bản chỉnh sửa được (OCR)
Có tấm ảnh chụp trang tài liệu mà cần gõ lại nội dung? OCR giúp bạn rút thẳng chữ ra để sửa, khỏi phải chép tay từng dòng.
Bạn chụp lại một trang hợp đồng, một tờ thông báo hay một bài báo cũ, giờ cần lấy phần chữ ra để sửa, dịch hoặc chép vào email. Gõ lại tay thì lâu và dễ sai, nhất là văn bản dài. Công nghệ nhận dạng ký tự quang học — quen gọi tắt là OCR — sinh ra để làm đúng việc này: đọc chữ trong ảnh rồi trả về đoạn văn bản bạn có thể bôi đen, chỉnh sửa như vừa gõ máy. Bài này chỉ cách dùng OCR cho ảnh chụp và cho cả file PDF scan, kèm mẹo chụp để máy đọc đúng dấu tiếng Việt.
OCR là gì và khi nào cần đến
Máy tính lưu một tấm ảnh dưới dạng các điểm màu, nó không “biết” trong ảnh có chữ gì — với nó, một trang giấy đầy chữ cũng chỉ là một bức tranh. Vì thế bạn không bôi đen hay tìm kiếm được chữ trong ảnh. OCR là bước trung gian: phần mềm dò trong ảnh những hình thù giống chữ cái, so khớp với bộ mẫu rồi ghép lại thành văn bản thật. Bạn cần đến OCR trong ba tình huống quen thuộc: có ảnh chụp một trang giấy và muốn lấy chữ ra, có file PDF là bản scan mà mở lên bôi đen không được, hoặc muốn số hoá một tập tài liệu giấy để lưu trữ và tìm kiếm về sau.
Chụp thế nào để máy đọc đúng
Chất lượng văn bản OCR phụ thuộc gần như hoàn toàn vào ảnh đầu vào. Một tấm ảnh rõ, thẳng, đủ sáng cho kết quả gần như sạch, trong khi ảnh mờ và nghiêng thì máy đọc sai đầy lỗi, dò lại còn mệt hơn gõ mới. Vài nguyên tắc khi chụp:
- Đặt trang giấy trên mặt phẳng và chụp thẳng từ trên xuống để dòng chữ không bị xiên hay cong ở mép.
- Lấy ánh sáng đều, tránh bóng của điện thoại hay bàn tay đổ lên trang; ánh sáng ban ngày cạnh cửa sổ thường là đủ và dịu nhất.
- Giữ máy chắc tay cho nét và chạm lấy nét vào phần chữ; ảnh rung nhoè là nguyên nhân đọc sai nhiều nhất.
- Chụp cận để chữ chiếm phần lớn khung hình, đừng để dư quá nhiều nền thừa quanh trang.
- Ưu tiên nền trắng chữ đen; tránh giấy có hoa văn, bị ố vàng hay ánh bóng loáng phản sáng.
Nhận dạng chữ từ một tấm ảnh
Với ảnh chụp lẻ, dùng công cụ Nhận dạng chữ (OCR): tải ảnh lên hoặc dán trực tiếp từ clipboard, chọn ngôn ngữ tiếng Việt để máy nhận đúng các dấu thanh, rồi lấy đoạn văn bản trả về. Bạn chép nó sang Word, sang email hay ô tìm kiếm tuỳ ý. Vì công cụ chạy ngay trên máy bạn nên ảnh giấy tờ riêng tư không bị tải lên đâu, cứ nhận dạng thoải mái cho đến khi ưng.
Nhận dạng chữ (OCR)Ảnh, PDF scan thành chữXử lý file PDF scan nhiều trang
Nếu thứ bạn có là một file PDF scan dày nhiều trang — hợp đồng, tài liệu, sổ tay — thì thay vì tách rồi nhận dạng từng ảnh, dùng công cụ PDF sang Word. Nó tự phát hiện trang nào là ảnh và chạy OCR tiếng Việt trên trang đó, rồi kết xuất ra file .docx mở bằng Word chỉnh sửa được, cố gắng giữ lại bố cục cơ bản của trang. Đây là cách nhanh nhất khi bạn cần cả nội dung lẫn dàn trang, chứ không chỉ mấy dòng chữ rời rạc.
Chuyển PDF sang WordPDF (kể cả ảnh scan) → .docxVì sao OCR vẫn sai và cách soát lại
Không công cụ OCR nào đúng tuyệt đối, đặc biệt với tiếng Việt vì các dấu thanh và dấu mũ xếp sát nhau rất dễ bị đọc nhầm — “à” đọc thành “a”, “ệ” thành “ê”, số 0 lẫn với chữ O, số 1 lẫn với chữ l. Sau khi nhận dạng, hãy dành một lượt soát lại, ưu tiên những chỗ dễ sai nhất:
- Các con số quan trọng như số tiền, số căn cước, ngày tháng — chỉ lệch một chữ số là hỏng cả tài liệu.
- Tên riêng, tên địa danh, vì chúng không nằm trong từ điển nên máy hay đoán sai.
- Dấu câu và chỗ xuống dòng, nhất là khi trang gốc chia hai cột hoặc chứa bảng biểu.
- Những chữ có dấu chồng nhiều lớp như “ữ”, “ợ”, “ẩ” dễ bị rơi mất một dấu.
Cả nhận dạng ảnh lẫn chuyển PDF scan đều chạy ngay trong trình duyệt trên máy bạn, tài liệu không được gửi lên máy chủ nào — nên yên tâm với cả giấy tờ có thông tin cá nhân. Bạn làm bao nhiêu lần cũng được, hoàn toàn miễn phí; chỉ cần nhớ luôn đọc soát lại kết quả trước khi dùng vào việc quan trọng.