Nhận dạng chữ (OCR)
Đọc chữ trong ảnh chụp, ảnh scan và file PDF rồi trả về văn bản bạn sửa, sao chép hoặc tải về được. Máy đọc tốt chữ in rõ nét; chữ viết tay và ảnh mờ vẫn sai nhiều nên hãy đọc soát lại.
Cách dùng công cụ nhận dạng chữ (ocr)
- 1Kéo thả ảnh (PNG, JPG, WebP) hoặc file PDF vào khung chọn file — chọn được nhiều file một lúc.
- 2Chọn ngôn ngữ trong tài liệu: tiếng Việt, tiếng Anh hoặc cả hai; với PDF thì chọn thêm khoảng trang cần đọc.
- 3Bấm "Bắt đầu nhận dạng" và theo dõi thanh tiến độ — lần đầu lâu hơn vì trình duyệt phải tải mô hình ngôn ngữ.
- 4Đọc soát rồi sửa thẳng trong ô văn bản, sau đó sao chép hoặc tải về file .txt.
Câu hỏi thường gặp
›OCR tiếng Việt có dấu có chính xác không?
Với chữ in rõ nét, chụp thẳng và đủ sáng thì thường đúng trên 95%, dấu vẫn giữ nguyên. Ảnh mờ, chụp nghiêng, chữ nhỏ hoặc nền nhiều hoa văn thì dấu hay bị nhầm — nên đọc soát lại trước khi dùng.
›Có đọc được chữ viết tay không?
Gần như không. Mô hình được huấn luyện cho chữ in, gặp chữ viết tay sẽ trả về kết quả lộn xộn. Chữ ký, ghi chú tay trên tài liệu scan cũng vậy.
›File PDF nhiều trang thì xử lý thế nào?
Mỗi trang được dựng thành ảnh 200 DPI rồi mới đọc chữ, kết quả tách riêng theo từng trang. Mỗi trang mất vài giây nên tài liệu dài bạn hãy chọn khoảng trang cần đọc thay vì chạy cả file.
›Vì sao lần đầu bấm nhận dạng lại lâu?
Lần đầu trình duyệt phải tải bộ nhận dạng và mô hình ngôn ngữ (khoảng 2–4 MB) từ chính trang này. Sau đó chúng nằm trong bộ nhớ đệm nên những lần sau bắt đầu gần như ngay lập tức.