Vì sao cần RAG
RAG giữ tri thức bên ngoài mô hình, cập nhật nhanh và kiểm soát nguồn trích dẫn.
Chunking strategy
Chia theo ngữ nghĩa với 500–800 token và overlap khoảng 15%.
Embedding và retrieval
Kết hợp vector search với BM25 và rerank.
Đánh giá
Đo recall@k và faithfulness trên bộ câu hỏi vàng.


