Hiểu quy trình retrieval, chunking, embedding và cách đánh giá một hệ thống hỏi đáp có căn cứ.
RAG là cách tìm các đoạn dữ liệu liên quan rồi đưa chúng vào ngữ cảnh để mô hình tạo câu trả lời. Phương pháp này giúp hệ thống dùng kiến thức riêng mà không phải huấn luyện lại mô hình.
Quy trình RAG cơ bản
Tài liệu được làm sạch và chia thành các đoạn. Mỗi đoạn được biểu diễn để có thể tìm kiếm theo ý nghĩa. Khi người dùng hỏi, hệ thống lấy các đoạn gần nhất, ghép vào prompt và yêu cầu mô hình trả lời dựa trên chúng.
Chunking quyết định chất lượng
Đoạn quá ngắn làm mất bối cảnh; đoạn quá dài chứa nhiều nhiễu. Hãy chia theo cấu trúc tự nhiên như tiêu đề, mục và đoạn văn, đồng thời lưu metadata về nguồn, ngày cập nhật và quyền truy cập.
Không chỉ đánh giá câu trả lời
Tách đánh giá thành hai phần: retrieval có tìm đúng đoạn không và generation có bám sát đoạn đã tìm không. Nếu retrieval sai, thay prompt thường không giải quyết được gốc vấn đề.
Checklist triển khai
- Chỉ truy xuất tài liệu người dùng được phép xem. - Hiển thị nguồn hoặc trích đoạn hỗ trợ câu trả lời. - Có phương án khi không tìm đủ dữ liệu. - Theo dõi câu hỏi thất bại để cải thiện kho tài liệu.


