
Khi doanh nghiệp nói "huấn luyện AI bằng dữ liệu của công ty tôi", thứ họ thật sự cần hầu như luôn là một cơ chế khác và rẻ hơn nhiều: tìm đúng đoạn tài liệu rồi đưa cho mô hình đọc trước khi trả lời. Cách làm này thường được gọi là RAG (retrieval-augmented generation). Hiểu nó không cần kiến thức kỹ thuật, và hiểu rồi thì bạn biết ngay khi nào nó sẽ hỏng.
Bốn bước, không hơn
- 1Chia nhỏ tài liệu. Mọi file (quy trình, hợp đồng mẫu, hướng dẫn kỹ thuật) được cắt thành các đoạn vài trăm chữ.
- 2Đánh chỉ mục theo ngữ nghĩa. Mỗi đoạn được chuyển thành một dãy số biểu diễn ý nghĩa của nó, lưu vào cơ sở dữ liệu. Hai đoạn nói cùng một ý sẽ có dãy số gần nhau, kể cả khi dùng từ khác nhau.
- 3Tìm đoạn liên quan. Khi có câu hỏi, hệ thống tìm vài đoạn gần nghĩa nhất — giống tìm kiếm, nhưng theo ý chứ không theo từ khoá.
- 4Trả lời kèm nguồn. Các đoạn tìm được đưa cho mô hình cùng câu hỏi, kèm yêu cầu: chỉ trả lời dựa trên đoạn này, và ghi rõ trích từ tài liệu nào.
Toàn bộ "trí tuệ" nằm ở bước 3 và 4. Mô hình không hề học thuộc tài liệu công ty bạn — nó chỉ đọc phần được đưa vào tại thời điểm hỏi. Đây là điểm quan trọng: bạn cập nhật tài liệu, hệ thống trả lời theo bản mới ngay, không phải huấn luyện lại.
Vì sao trợ lý trả lời sai
Gần như mọi lỗi đều nằm ở bước 3, không phải bước 4. Nếu hệ thống tìm nhầm đoạn thì mô hình dù giỏi đến đâu cũng trả lời trên tư liệu sai. Các nguyên nhân hay gặp:
- Tài liệu mâu thuẫn. Có ba phiên bản quy trình, không bản nào ghi ngày hiệu lực. Hệ thống chọn nhầm bản cũ.
- Câu trả lời nằm trong bảng hoặc ảnh scan. Nếu không xử lý riêng, bảng bị cắt vụn và mất ý nghĩa.
- Câu hỏi cần tổng hợp nhiều nguồn. "Tổng doanh thu quý trước" không nằm ở đoạn văn nào cả — loại câu hỏi này phải hỏi cơ sở dữ liệu, không phải hỏi tài liệu.
- Ngữ cảnh bị thiếu. Đoạn tài liệu ghi "trường hợp này không áp dụng" mà không nhắc lại "trường hợp này" là gì, vì phần đó nằm ở đoạn trước.
Một trợ lý nội bộ tốt là trợ lý biết nói "tôi không tìm thấy trong tài liệu" thay vì đoán.
Chuẩn bị tài liệu: phần quyết định chất lượng
Chất lượng đầu ra phụ thuộc vào kho tài liệu nhiều hơn phụ thuộc vào mô hình. Trước khi triển khai, nên làm ba việc:
- 1Bỏ bản cũ, hoặc đánh dấu rõ bản nào còn hiệu lực. Đây là việc tốn công nhất và cũng đáng giá nhất.
- 2Chuyển các file ảnh scan thành văn bản đọc được, đặc biệt là bảng biểu.
- 3Ghi tiêu đề và ngày hiệu lực vào từng tài liệu, để hệ thống ưu tiên bản mới khi có xung đột.
Kiểm soát chất lượng bằng bộ câu hỏi mẫu
Cách đo đơn giản và hiệu quả: soạn 30–50 câu hỏi mà nhân viên thật sự hay hỏi, kèm đáp án đúng do người am hiểu duyệt. Sau mỗi lần thay đổi (thêm tài liệu, đổi cách chia đoạn, đổi mô hình), chạy lại bộ này và đếm số câu đúng.
Không có bộ câu hỏi mẫu thì mọi cải tiến đều là cảm tính, và rất dễ rơi vào cảnh sửa chỗ này hỏng chỗ kia mà không ai biết.
Vấn đề quyền xem tài liệu
Đây là chỗ hay bị bỏ sót và có thể gây hậu quả thật. Nếu kho tài liệu có cả bảng lương, hợp đồng nhân sự hay giá vốn, trợ lý phải lọc theo quyền của người đang hỏi, ngay ở bước tìm kiếm — không phải lọc ở câu trả lời.
Khi nào KHÔNG nên dùng cách này
- Câu hỏi cần con số chính xác từ cơ sở dữ liệu (doanh thu, tồn kho, công nợ) — hãy truy vấn trực tiếp và trả về con số, đừng để mô hình đọc từ văn bản.
- Kho tài liệu quá nhỏ (dưới vài chục trang) — lúc đó đưa thẳng toàn bộ vào ngữ cảnh còn đơn giản và chính xác hơn.
- Nội dung thay đổi từng phút — phải nối thẳng vào nguồn dữ liệu sống thay vì đánh chỉ mục định kỳ.
Chi phí vận hành của loại hệ thống này phụ thuộc vào lượng câu hỏi và độ dài tài liệu đưa vào mỗi lần; cách ước tính nằm ở bài Chi phí vận hành một tính năng AI.
Cần bàn cụ thể?
SealCore khảo sát tại doanh nghiệp bạn và báo giá trọn gói sau buổi đầu tiên — kể cả khi kết luận là bạn chưa cần viết phần mềm riêng.


