Chuyển đến nội dung
Phần mềm

Looking-Back-OCR: OCR sách cũ tiếng Việt bằng Gemini hoặc Meta AI

Minh họa trừu tượng cho công cụ OCR tài liệu scan tiếng Việt

Nhiều sách cũ và tài liệu scan tiếng Việt còn đọc được bằng mắt nhưng khó tra cứu, in lại hoặc biên tập vì chữ mờ và bố cục phức tạp. Looking-Back-OCR là một dự án mã nguồn mở của kiencang, dùng mô hình AI để tái tạo nội dung PDF scan theo hai hướng: bản HTML/CSS ưu tiên bố cục hoặc Markdown ưu tiên nội dung có thể biên tập.

Bài viết kiểm tra repository, release và bản web do tác giả liên kết ngày 19/08/2026. Đây là công cụ đang phát triển; hãy coi kết quả AI là bản nháp cần đối chiếu với trang scan, không phải bản sao hoàn hảo hay chứng cứ nguyên gốc.

Looking-Back-OCR là gì?

Đây là ứng dụng web OCR hướng đến sách xưa, tài liệu scan và văn bản tiếng Việt bị mờ. Theo README, công cụ nhận PDF scan, chia thành các phần để xử lý bằng Gemini hoặc Meta AI, sau đó cho xem lại và xuất kết quả. Dự án có mã nguồn công khai theo giấy phép MIT tại GitHub.

Repository có release v1.0.44 ngày 19/08/2026. Release này không có file cài đặt cho Windows/macOS: người dùng thông thường nên mở bản AI Studio hoặc bản web mà tác giả liên kết, thay vì hiểu nhầm GitHub Release là bộ cài desktop.

Hai kiểu đầu ra: chọn theo mục đích

Chế độPhù hợp khiCần lưu ý
Bảo toàn (HTML/CSS)Muốn đọc bản tái tạo gần với bố cục gốc, ví dụ trang nhiều cột.Là tái tạo bằng AI, không bảo đảm font, cỡ chữ hay mọi chi tiết giống bản scan.
Đơn giản (Markdown)Cần nội dung gọn để đọc, tra cứu hoặc biên tập tiếp.Theo README, hướng này có thể xuất DOCX; vẫn phải soát lỗi tên riêng, dấu câu và bảng biểu.

Cách dùng bản web một cách thận trọng

  1. Mở bản web Looking-Back-OCR hoặc liên kết AI Studio trong README.
  2. Đọc hướng dẫn, chọn chế độ Đơn giản hoặc Bảo toàn trước khi bắt đầu xử lý.
  3. Nhập API key của nhà cung cấp AI theo giao diện khi cần. Không gửi key cho người khác, không chụp màn hình key và xóa key khỏi trình duyệt chung sau khi dùng.
  4. Tải lên PDF mà bạn có quyền số hóa/biến đổi. Bản web hiện hiển thị giới hạn tối đa 100 MB và 500 trang; giới hạn thực tế của API/model có thể thay đổi.
  5. Xử lý từng phần nếu tài liệu dài; đối chiếu trang scan với bản OCR, đặc biệt là tiêu đề, tên người, niên đại, số liệu, thơ, công thức và bảng.
  6. Chỉ xuất HTML, Markdown hoặc DOCX sau khi đã rà soát. Giữ PDF gốc để truy xuất khi cần kiểm chứng.

Dữ liệu và bản quyền: điểm không được bỏ qua

Mã nguồn cho thấy ứng dụng lưu API key trong browser storage và có lịch sử xử lý trong IndexedDB của trình duyệt. Nhưng khi thực hiện OCR, dữ liệu/chunk tài liệu được gửi đến API Gemini hoặc Meta AI tùy model đã chọn. Vì vậy không nên diễn giải đây là công cụ OCR offline hoặc cam kết dữ liệu không rời khỏi máy.

README của dự án đặc biệt lưu ý: với Gemini AI Studio dùng key miễn phí hoặc model Muse trợ giá, chỉ nên tải lên tài liệu đã hết hạn bản quyền vì dữ liệu tải lên có thể được dùng để huấn luyện mô hình theo mô tả của tác giả. Ngoài điều khoản của từng nhà cung cấp, người dùng vẫn phải có quyền số hóa, OCR, chuyển đổi và chia sẻ tài liệu. Không dùng công cụ để sao chép hoặc phát hành lại sách còn bản quyền khi chưa được phép.

Điểm mạnh và giới hạn

  • Phù hợp để thử tái tạo bản đọc dễ hơn từ sách/tạp chí cũ scan tiếng Việt.
  • Có hai hướng đầu ra rõ ràng: ưu tiên bố cục hoặc ưu tiên văn bản biên tập.
  • Có thể xuất HTML, Markdown và DOCX theo mã nguồn/README.
  • Không có bảo đảm OCR đúng tuyệt đối; dự án cũng có tuyên bố từ chối trách nhiệm.
  • Kết quả, chi phí, model được dùng, chính sách dữ liệu và khả năng xử lý có thể phụ thuộc API key, tài khoản và nhà cung cấp.

Kết luận

Looking-Back-OCR đáng để thử khi bạn có sách cũ hoặc PDF scan tiếng Việt được phép xử lý và cần một bản đọc/biên tập thuận tiện hơn. Hãy bắt đầu với một vài trang, kiểm tra kỹ bản OCR với bản gốc và chỉ đưa lên AI những tài liệu phù hợp về quyền sử dụng lẫn mức độ nhạy cảm.

Nguồn chính thức

Tham gia thảo luận

Your email address will not be published. Required fields are marked *