Về trang blog
Truy hồiĐa ngôn ngữ

Điều gì làm hỏng chất lượng truy hồi trên tài liệu tiếng Việt

12 thg 6, 2026·Đọc 6 phút

Một hệ truy hồi được tinh chỉnh trên kho tiếng Anh thường mất recall thấy rõ ở lần đầu gặp bộ tài liệu tiếng Việt. Nguyên nhân đều rất đời thường.

Chuẩn hoá dấu một lần, ngay khi nạp dữ liệu

Cùng một từ xuất hiện dưới dạng Unicode tổ hợp hoặc dựng sẵn tuỳ trình soạn thảo tạo ra file. Hãy chuẩn hoá về một dạng trước khi embedding và trước khi index từ khoá, nếu không hai dạng sẽ thành hai token khác nhau.

Từ tiếng Việt không phân tách bằng khoảng trắng

Tìm kiếm từ khoá cắt theo dấu cách sẽ coi "cơ sở dữ liệu" là ba token rời rạc. Một bộ tách từ, hoặc một index bigram đi kèm index unigram, lấy lại được phần lớn mức mất mát đó cho BM25. Phía vector ít nhạy cảm hơn nhưng vẫn được lợi.

Hãy chuẩn bị cho tài liệu trộn ngôn ngữ

Tài liệu nội bộ hiếm khi thuần một ngôn ngữ — văn tiếng Việt lẫn tên sản phẩm tiếng Anh, chuỗi lỗi và định danh trong mã nguồn. Một mô hình embedding đa ngôn ngữ đặt cả hai ngôn ngữ vào cùng không gian vector giúp khỏi phải duy trì index riêng cho từng ngôn ngữ, và cho phép câu hỏi tiếng Anh truy hồi đúng đoạn tiếng Việt.

Giữ nguyên ngôn ngữ của câu hỏi

Dịch câu hỏi trước khi truy hồi làm mất tên riêng và thêm một điểm hỏng. Nếu mô hình embedding thực sự đa ngôn ngữ, hãy truy hồi bằng đúng ngôn ngữ người dùng hỏi và để bước sinh văn bản lo phần ngôn ngữ của câu trả lời.

Thử Ragenta trên chính tài liệu của bạn.

Kết nối một nguồn, đặt một câu hỏi, và xem đúng những đoạn văn đứng sau câu trả lời.

Đặt lịch demo