OCR — nhận dạng chữ
OCR là công đoạn máy đọc chữ trong ảnh và trả lại văn bản gõ được. Bộ nhận dạng ở đây chạy bằng WebAssembly ngay trong trình duyệt nên hoá đơn, hợp đồng hay chứng minh thư bạn đưa vào đều không đi đâu cả.
Không tải tệp lên
Không có bước gửi file đi. Trình duyệt tự đọc từ ổ đĩa và xử lý tại chỗ.
Ngắt mạng vẫn chạy
Trang tải xong là bạn có thể rút mạng — cách kiểm chứng đơn giản nhất.
Không lưu nội dung bạn nhập
Nội dung bạn gõ và tệp bạn mở không được lưu lại; xử lý xong là mất khỏi bộ nhớ tab.
Câu hỏi thường gặp
›OCR là gì, dùng vào việc gì?
OCR (Optical Character Recognition) là kỹ thuật cho máy đọc chữ in trong ảnh rồi trả về văn bản. Hay dùng nhất là lấy lại nội dung từ tài liệu scan, ảnh chụp hợp đồng, hoá đơn để khỏi phải gõ lại.
›Có cần cài phần mềm hay đăng ký tài khoản không?
Không. Mọi thứ chạy trong trình duyệt bằng thư viện Tesseract biên dịch sang WebAssembly, miễn phí và không cần tài khoản. Lần đầu dùng, trình duyệt tải về mô hình ngôn ngữ khoảng 2–4 MB; sau đó bạn ngắt mạng vẫn nhận dạng được.
›Ảnh của tôi có bị gửi lên máy chủ không?
Không. Trang không có máy chủ xử lý ảnh. Ảnh được đọc thẳng từ ổ đĩa, xử lý bằng WebAssembly trong tab của bạn, và không có yêu cầu mạng nào mang nội dung ảnh đi.
›Nhận dạng xong tôi làm gì với văn bản?
Bạn sửa trực tiếp trong ô kết quả rồi sao chép hoặc tải về file .txt. Muốn đóng gói lại thành tài liệu, dán văn bản vào công cụ Tạo PDF bên nhóm Công cụ PDF để xuất một file PDF có chữ chọn và tìm kiếm được. Nếu tài liệu là PDF scan bị xoay ngược, hãy chỉnh lại bằng Sắp xếp & xoay trang rồi mới nhận dạng.