HPT Tech - Công ty TNHH đầu tư xây dựng và thiết bị công nghệ HPT

kinhdoanh@hpttech.vn8:00 - 17:30
HPT Tech
22/07/2026Giải pháp số hoá > Số hóa tài liệu

Số hóa mà không tra cứu được: Vì sao chỉ quét thành ảnh là chưa đủ

Quét giấy thành PDF ảnh chưa phải là số hóa thực thụ. OCR tạo lớp văn bản tìm kiếm được, chuẩn PDF/A và siêu dữ liệu mới biến kho ảnh scan thành dữ liệu dùng được.

Nhiều tổ chức tự tin rằng mình đã “số hóa xong” khi hàng vạn trang giấy được quét thành tệp PDF và cất lên máy chủ. Nhưng nếu mở một tệp như vậy ra, thử bôi đen một dòng chữ mà không được, gõ một từ khóa mà máy báo “không có kết quả”, thì thực chất đó mới chỉ là một tấm ảnh chụp trang giấy. Số hóa đúng nghĩa đòi hỏi nhiều hơn một chiếc máy quét: cần nhận dạng ký tự quang học (OCR) để tạo ra lớp văn bản tìm kiếm được, cần chuẩn định dạng lưu trữ lâu dài và cần siêu dữ liệu để kho tài liệu thực sự có thể tra cứu, khai thác.

Bản quét chỉ là ảnh, máy không “đọc” được

Khi quét một trang giấy, thiết bị chỉ ghi lại hình ảnh của trang đó. Tệp PDF thu được — thường gọi là “PDF một lớp” — hiển thị đúng như bản gốc, nhưng với máy tính nó không khác gì một bức ảnh: không thể chọn chữ, không thể sao chép nội dung và không thể tìm kiếm bên trong. Người dùng chỉ có thể tra theo tên tệp, nên khi có hàng nghìn tệp đặt tên tùy tiện, việc tìm lại một văn bản trở thành cực hình.

OCR giải quyết điều này bằng cách phân tích ảnh, nhận diện từng ký tự rồi chèn một “lớp văn bản” vô hình nằm khớp bên dưới lớp ảnh. Kết quả là “PDF hai lớp”: giao diện vẫn là ảnh y hệt bản gốc để bảo toàn hình thức, nhưng bên dưới đã có văn bản để máy đọc. Từ đó có thể bôi đen, sao chép và tìm kiếm từ khóa như với một tài liệu soạn thảo bình thường.

Cán bộ tiếp nhận và xử lý chồng hồ sơ giấy bên máy tính tại bộ phận một cửa

Khối lượng hồ sơ, giấy tờ khổng lồ chỉ thực sự hữu ích khi được chuyển thành dữ liệu có thể tra cứu, chứ không dừng ở những tệp ảnh rời rạc.

OCR tiếng Việt và bài toán dấu thanh

Với tiếng Việt, OCR khó hơn nhiều so với tiếng Anh. Hệ thống dấu thanh và dấu phụ dày đặc khiến nhiều công cụ vốn tối ưu cho tiếng Anh nhận dạng sai: có trường hợp tài liệu sau khi OCR chỉ tìm được nếu người dùng gõ tiếng Việt không dấu, tức là dấu đã bị bỏ hoặc bị nhận nhầm. Đây chính là lý do cần dùng công cụ OCR được huấn luyện riêng cho tiếng Việt thay vì mặc định phần mềm phổ thông.

Về độ chính xác, với chữ in rõ nét, sạch và quét đúng chuẩn, các giải pháp thương mại thường đạt trên 95%. Nhưng con số này giảm mạnh khi gặp chữ viết tay, tài liệu cũ ố mờ hoặc phông chữ đặc biệt. Các phép đo kỹ thuật độc lập cho thấy khoảng cách rất lớn: cùng một công cụ có thể gần như không sai với chữ in nhưng sai tới hơn một nửa số ký tự khi gặp chữ viết tay tiếng Việt. Nói cách khác, chất lượng đầu vào và việc chọn đúng công cụ quyết định phần lớn thành bại của cả dự án.

Từ chữ Hán-Nôm đến ứng dụng trên điện thoại

Ranh giới khó nhất của OCR tiếng Việt là kho tư liệu chữ Hán-Nôm trong sắc phong, châu bản, gia phả, hoành phi, câu đối. Tập ký tự lên tới hàng chục nghìn loại, thiếu dữ liệu huấn luyện, và phần lớn di sản này đến nay vẫn chưa được chuyển sang chữ Quốc ngữ. Mới đây, một nhóm nghiên cứu trong nước công bố hoàn thành hệ thống nhận dạng và dịch tự động chữ Hán-Nôm từ ảnh sang Quốc ngữ, xây dựng kho dữ liệu lên tới hàng trăm nghìn ảnh trang tài liệu có gán nhãn — quy mô lớn nhất từ trước tới nay.

Thành quả không chỉ nằm trong phòng thí nghiệm. Một ứng dụng trên điện thoại cho phép người dân chụp ảnh hoành phi, câu đối hay sắc phong và tự động chuyển sang Quốc ngữ, với độ chính xác công bố trên 99% cho nhóm chữ phổ biến. Đây là minh chứng cho thấy OCR đã đủ trưởng thành để “mở khóa” cả những kho tài liệu tưởng chừng chỉ chuyên gia mới đọc được — và cũng cho thấy vì sao OCR là trái tim của mọi dự án số hóa.

PDF/A và chuẩn lưu trữ số của Việt Nam

OCR tạo ra nội dung máy đọc được, nhưng để tài liệu số sống lâu dài còn cần chuẩn định dạng phù hợp. PDF/A là phiên bản PDF thiết kế riêng cho lưu trữ: nhúng toàn bộ phông chữ, hình ảnh và màu sắc vào trong tệp, không phụ thuộc tài nguyên bên ngoài, đồng thời loại bỏ các thành phần động thiếu ổn định. Mục tiêu là bảo đảm tệp mở được và hiển thị đúng nguyên bản kể cả sau nhiều thập kỷ, khi phần mềm tạo ra nó đã lỗi thời. Việt Nam đã ban hành các tiêu chuẩn quốc gia tương đương chuẩn quốc tế cho định dạng này.

Quan trọng hơn, đây không chỉ là khuyến nghị kỹ thuật. Quy định hiện hành về lưu trữ tài liệu số yêu cầu tài liệu số hóa từ bản giấy phải ở định dạng PDF/A hai lớp — tức có cả ảnh lẫn lớp văn bản OCR; ảnh màu với độ sâu màu tối thiểu 24 bit; độ phân giải tối thiểu 200 điểm ảnh trên mỗi inch đối với tài liệu hành chính và 300 đối với bản đồ, bản vẽ; chữ ký số hiển thị ở góc trên bên phải trang đầu. Nói cách khác, “quét cho có” không đáp ứng chuẩn; số hóa phải làm đúng kỹ thuật ngay từ khâu đầu tiên.

Siêu dữ liệu: chìa khóa tra cứu quy mô lớn

Có OCR và PDF/A vẫn chưa đủ. Khi kho tài liệu lên tới hàng triệu trang, thứ giúp tìm đúng hồ sơ trong vài giây là siêu dữ liệu — các trường mô tả như mã hồ sơ, tiêu đề, thời hạn bảo quản, từ khóa, ngôn ngữ, số trang, tình trạng vật lý. Không ít đơn vị dù đã quét hàng nghìn tệp vẫn than “khó tìm, khó khai thác”, đơn giản vì thiếu chuẩn hóa siêu dữ liệu và cách đặt tên hồ sơ.

Đích đến cao nhất là cơ sở dữ liệu toàn văn: không chỉ tra theo tiêu đề hay siêu dữ liệu mà tìm kiếm trong toàn bộ nội dung văn bản. Đây chính là điều OCR mở ra — biến một kho ảnh tĩnh thành một cơ sở dữ liệu có thể hỏi đáp. Khi tài liệu số hóa bảo đảm toàn vẹn, truy cập được và có dấu hiệu xác thực, pháp luật lưu trữ cũng thừa nhận giá trị của bản số hóa, tạo tiền đề dần thay thế việc tra cứu trên bản giấy.

Làm đúng ngay từ đầu

Chi phí lớn nhất của số hóa không nằm ở lần quét đầu tiên mà ở việc phải làm lại vì làm sai. Một quy trình đúng bao gồm: quét ở độ phân giải phù hợp, chạy OCR bằng công cụ tối ưu cho tiếng Việt, lưu ở định dạng PDF/A hai lớp, gắn siêu dữ liệu chuẩn hóa và xây dựng khả năng tìm kiếm toàn văn. Đầu tư một lần cho đúng sẽ giúp kho tài liệu số phục vụ được nhiều năm, thay vì trở thành một “nghĩa địa ảnh” tốn dung lượng mà không ai tra cứu nổi. Trong hành trình chuyển đổi số, khác biệt giữa một đống tệp và một tài sản dữ liệu nằm ở đúng những lớp kỹ thuật thầm lặng ấy.