Về trang blog
Đánh giáKỹ thuật

Đánh giá RAG khi bạn chưa có tập dữ liệu gán nhãn

30 thg 6, 2026·Đọc 8 phút

Đội nào cũng nói sẽ dựng tập đánh giá "khi sản phẩm ổn định". Sản phẩm không bao giờ ổn định, và đến lúc đó thì mọi thay đổi đều là tung đồng xu.

Bắt đầu với ba mươi câu hỏi từ người dùng thật

Lấy từ ticket hỗ trợ, từ tuần đầu dùng nội bộ, từ những câu mọi người hỏi nhau trên Slack trước khi bạn xây bất cứ thứ gì. Ba mươi câu là đủ để bắt được suy giảm chất lượng; ba trăm câu thì thành một dự án riêng.

Chấm bốn thứ

  • Mức bám nguồn — mọi khẳng định có được một đoạn truy hồi chống lưng không?
  • Độ phủ trích dẫn — bao nhiêu phần trăm khẳng định có kèm liên kết?
  • Tỷ lệ truy hồi trúng — nguồn đúng có xuất hiện trong top-k hay không?
  • Độ liên quan của câu trả lời — nó có trả lời đúng câu được hỏi không?

Ba chỉ số đầu có thể chấm bằng máy hoặc bằng mô hình. Chỉ số thứ tư thường cần con người, và đó là thêm một lý do để giữ tập đánh giá nhỏ.

Tách lỗi truy hồi khỏi lỗi sinh văn bản

Nếu đoạn văn đúng chưa bao giờ lọt vào ngữ cảnh thì tinh chỉnh prompt là công sức đổ sông. Tỷ lệ truy hồi trúng cho biết cần sửa nửa nào của hệ thống, và đó cũng là chỉ số rẻ nhất để thu thập.

Chạy nó ở mọi thay đổi

Một bài đánh giá chạy hai lần mỗi năm là một bản báo cáo. Một bài đánh giá chạy ở mọi thay đổi cấu hình là lưới an toàn. Gần như toàn bộ giá trị nằm ở cái thứ hai.

Thử Ragenta trên chính tài liệu của bạn.

Kết nối một nguồn, đặt một câu hỏi, và xem đúng những đoạn văn đứng sau câu trả lời.

Đặt lịch demo