Bạn vừa chuyển PDF sang Word và thấy một màn "chữ Morse"?
Bạn nhận từ sếp một bản PDF danh mục hàng hóa, chuyển sang Word để nhập liệu, mở file ra thì thấy "Hµ Néi" thay vì "Hà Nội", hoặc cả trang ô vuông □□□. Hoặc tệ hơn: chuyển xong mà file Word trống trơn, chẳng có chữ nào.
Đây là tình huống cực kỳ phổ biến ở Việt Nam — nơi văn bản hành chính, giáo án, hợp đồng cũ vẫn còn nằm ở các hệ mã tiếng Việt trước Unicode (TCVN3, VNI). Và quan trọng nhất: mỗi dạng lỗi font có nguyên nhân và cách sửa khác nhau. Dùng sai cách, bạn sẽ ngồi gõ lại cả 50 trang.
Bài này giúp bạn chẩn đoán chính xác trong 30 giây file của mình bị lỗi gì, rồi xử lý đúng đường — không mò mẫn thử hết công cụ này đến công cụ khác.
Bước 1: Copy thử một đoạn chữ từ PDF gốc
Mở file PDF gốc (chưa chuyển), bôi đen một đoạn có dấu tiếng Việt và copy ra Notepad hoặc Google Docs.
Kết quả copy chính là "bản chất thật" của lớp văn bản bên trong PDF — và nó chia làm 4 nhóm dấu hiệu:
| Dấu hiệu khi copy/đọc PDF gốc | Loại lỗi | Mức độ xử lý |
|---|---|---|
| "Hµ Néi", "Tr¹ng" — ký tự Latin lạ lùng | PDF dựng trên mã TCVN3/VNI cũ | Khó — cần OCR |
| Ô vuông □□□ hoặc dấu chấm ●●● | Thiếu font / thiếu bảng mã ánh xạ | Khó — cần OCR |
| Copy ra đọc bình thường, chỉ khi chuyển Word mới hỏng | Công cụ chuyển đổi yếu | Dễ — đổi công cụ |
| Bôi đen không nổi chữ, trỏ chuột chọn cả trang như chọn ảnh | File scan (ảnh chụp) | Bắt buộc OCR |
💡 Mẹo: Nếu bạn copy được chữ nhưng thấy sai dấu kiểu "Hµ Néi", đừng cố cài font TCVN3 rồi gõ lại — đó là cứa hỏng thời gian. Đi thẳng OCR ở Bước 3.
Bước 2: Trường hợp copy ra đúng — lỗi nằm ở công cụ chuyển đổi
Nếu copy từ PDF gốc ra chuẩn từng dấu nhưng file Word sau chuyển đổi lại hỏng chữ, chúc mừng: PDF của bạn là lớp văn bản Unicode hoàn chỉnh, chỉ có điều công cụ bạn dùng đã "đọc sai" bảng mã ánh xạ (ToUnicode map) khi trích xuất.
Cách xử lý: dùng công cụ chuyển PDF sang Word được tối ưu riêng cho tiếng Việt, ví dụ Chuyển PDF sang Word của CHUYENPDF.VN:
- Truy cập chuyenpdf.vn/chuyen-pdf-sang-word, kéo file PDF vào vùng tải lên (hỗ trợ file PDF, tối đa 100MB).
- Hệ thống hiện "Đang phân tích loại PDF..." rồi tự động kiểm tra lớp văn bản và phát hiện lỗi font/encoding trước khi chuyển đổi.
- Nếu file khỏe, bấm "Chuyển PDF sang Word" — dấu sắc, huyền, hỏi, ngã, nặng được giữ nguyên, sau đó bấm "Tải file Word" để nhận file .docx.
Nội dung trình duyệt xử lý ngay trên máy bạn, không phải tải file lên server — tiết kiệm được vài phút lo lắng về hồ sơ hợp đồng đang gửi đi.
Bước 3: Trường hợp copy ra đã sai — lỗi nằm trong chính file PDF
Khi copy từ PDF gốc ra đã là "Hµ Néi" hoặc □□□, lớp văn bản bên trong đã hỏng từ gốc. Không có công cụ chuyển đổi nào "sửa được" dữ liệu vốn không tồn tại — cách đúng là nhận dạng lại văn bản từ hình ảnh trang PDF bằng OCR:
- Mở OCR PDF với AI của CHUYENPDF.VN — hỗ trợ PDF / JPG / PNG / WebP.
- Chọn ngôn ngữ "Tiếng Việt" (hoặc "Tự động phát hiện").
- Ở định dạng xuất, chọn "Word (.docx)" nếu cần file chỉnh sửa, hoặc "Văn bản thuần (.txt)" nếu chỉ cần lấy nội dung.
- Bấm OCR, chờ vài giây rồi tải kết quả về — đây là văn bản được nhận dạng lại từ ảnh, nên dấu tiếng Việt được dựng chuẩn Unicode ngay từ đầu.
Vì OCR đọc hình ảnh của trang chứ không đọc lớp ký tự hỏng, nó "bỏ qua" hoàn toàn lỗi mã TCVN3/VNI và ô vuông trong file gốc.
Bước 4: File scan — chẩn đoán trước để đỡ mất công
Nhiều bạn nhầm file scan là "lỗi font" trong khi bản chất nó là ảnh chụp trang giấy, không hề có lớp chữ bên trong. Nhận biết nhanh: bôi đen thử chữ trong PDF — nếu trỏ chuột quét trọn cả trang như quét một tấm ảnh, đó là file scan.
Với file scan, mọi công cụ chuyển PDF sang Word thông thường đều bó tay — không có chữ để mà trích xuất. Đường duy nhất là OCR PDF tiếng Việt, đã hướng dẫn ở Bước 3.
Vì sao lỗi font tiếng Việt phổ biến ở Việt Nam đến vậy?
Ba hệ mã tiếng Việt từng tồn tại song song trước khi Unicode thống nhất:
- Unicode (UTF-8): chuẩn hiện đại, mọi nền tảng đều đọc được.
- TCVN3 (ABC): chuẩn Việt Nam thời văn bản hành chính cũ — chữ có dấu nằm ở vị trí ký tự Latin khác hẳn.
- VNI: hệ mã phổ biến ở miền Nam thời máy tính đời đầu.
Văn bản soạn trên font TCVN3/VNI rồi xuất PDF chỉ đúng mắt người đọc, còn lớp ký tự bên trong "nói" một ngôn ngữ mà Word hôm nay không hiểu. Khi công cụ chuyển đổi trích xuất đúng từng ký tự đó ra .docx, bạn nhận về đúng những gì nó đọc được — "Hµ Néi".
Kịch bản người Việt hay gặp: PDF danh mục từ đối tác cũ
Chuyện thường thấy ở dân văn phòng: đối tác gửi qua Zalo một file PDF báo giá soạn từ thời phần mềm cũ, sếp yêu cầu "nhập lại sang Excel/Word trong chiều nay". Copy thử — "Hµ Néi". Lúc này:
- Đừng cài font TCVN3 rồi sửa thủ công từng ô — 50 trang mất cả buổi.
- Đưa file thẳng qua OCR PDF, nhận dạng lại thành văn bản Unicode chuẩn, rồi dán vào Word/Excel chỉnh tiếp.
Câu hỏi thường gặp
Sửa lỗi font khi chuyển từ PDF sang Word bằng cách cài thêm font TCVN3/VNI có được không?
Cài font chỉ giúp bạn đọc được file gốc trên máy mình (một phần trường hợp), chứ không sửa được file Word đã xuất ra sai mã. Muốn có văn bản sạch để chỉnh sửa, đường ngắn nhất vẫn là OCR nhận dạng lại từ hình ảnh trang PDF.
Vì sao copy từ PDF ra đã sai dấu, trong khi hiển thị trên PDF lại đọc bình thường?
PDF hiển thị bằng hình dạng glyph đã nhúng sẵn trong file, còn thao tác copy dựa vào bảng ánh xạ ký tự (ToUnicode map) bên trong. Hai lớp này có thể lệch nhau: nhìn thì đúng, copy ra sai. Đó là dấu hiệu chắc chắn lớp văn bản đã hỏng từ gốc — dùng OCR.
Chuyển PDF sang Word không bị lỗi font bằng cách nào chắc chắn nhất?
Chia theo loại file: PDF có lớp văn bản Unicode khỏe → dùng công cụ chuyển đổi được tối ưu tiếng Việt như Chuyển PDF sang Word; PDF lỗi mã cũ (TCVN3/VNI), thiếu font hoặc file scan → OCR PDF nhận dạng lại. Chọn đúng đường theo loại file là cách chắc chắn nhất.
OCR với văn bản tiếng Việt có nhận diện đúng dấu không?
Công cụ OCR PDF với AI hỗ trợ riêng ngôn ngữ tiếng Việt, nhận dạng cả dấu sắc, huyền, hỏi, ngã, nặng. Với bản scan rõ nét, độ chính xác đủ để dùng làm bản nháp nhập liệu thay cho việc gõ lại từ đầu — bạn chỉ cần rà soát lại tên riêng và số liệu.
Có cách nào biết trước file PDF của mình có "khỏe" không, trước khi chuyển Word?
Có. Copy thử vài chữ có dấu từ PDF ra trình soạn thảo bất kỳ (Bước 1). Copy ra chuẩn → chuyển trực tiếp được; copy ra sai → chuẩn bị tinh thần đi OCR. Cách kiểm tra 30 giây này giúp bạn chọn đúng công cụ ngay từ đầu.
Kết luận
Lỗi font khi chuyển PDF sang Word không phải "một lỗi" mà là bốn lỗi khác nhau: mã TCVN3/VNI cũ, thiếu font/ánh xạ, công cụ chuyển đổi yếu, và file scan. Chẩn đoán đúng loại bằng mẹo copy 30 giây, rồi chọn đúng lối đi:
- Lớp văn bản Unicode khỏe → Chuyển PDF sang Word — xử lý ngay trên trình duyệt, giữ trọn dấu tiếng Việt.
- Lỗi mã cũ, ô vuông, hoặc bản scan → OCR PDF với AI — nhận dạng lại thành văn bản Unicode chuẩn, xuất thẳng .docx.
Làm đúng trình tự này, thay vì ngồi gõ lại "Hµ Néi" cả trăm trang, bạn sẽ xong việc trong vài phút.
