
Phần mềm thường có chi phí một lần để làm, rồi chi phí vận hành gần như cố định. Tính năng AI thì khác: chi phí chạy tỷ lệ thuận với mức độ sử dụng. Tính năng càng thành công, hoá đơn càng cao. Không lường trước điều này là lý do phổ biến khiến một tính năng đang chạy tốt bị tắt sau ba tháng.
Cơ chế tính tiền: token vào và token ra
Các nhà cung cấp mô hình tính tiền theo token — đơn vị nhỏ hơn một từ. Với tiếng Việt, một token trung bình tương đương khoảng nửa đến một âm tiết, nên một trang A4 khoảng 500 chữ rơi vào tầm 700–1.000 token.
Hai loại token được tính riêng và giá khác nhau:
- Token vào — mọi thứ bạn gửi cho mô hình: câu hỏi, hướng dẫn hệ thống, các đoạn tài liệu tìm được, lịch sử hội thoại.
- Token ra — phần mô hình viết trả lời. Thường đắt hơn token vào vài lần.
Giá cụ thể thay đổi liên tục và khác nhau giữa các mô hình, nên đừng chép một con số vào kế hoạch tài chính dài hạn — hãy tra bảng giá tại thời điểm triển khai. Điều không đổi là cấu trúc chi phí, và đó mới là thứ cần thiết kế cho đúng.
Chỗ chi phí âm thầm phình ra
Trong các hệ thống chúng tôi rà lại, chi phí vượt dự toán gần như luôn đến từ token vào, không phải token ra:
| Nguyên nhân | Vì sao tốn | Cách xử lý |
|---|---|---|
| Gửi cả lịch sử hội thoại mỗi lượt | Đến lượt thứ 20, mỗi câu hỏi mang theo 19 lượt trước | Tóm tắt phần cũ, chỉ giữ nguyên vài lượt gần nhất |
| Nhồi quá nhiều đoạn tài liệu | Lấy 20 đoạn cho chắc thay vì 4 đoạn đúng | Cải thiện bước tìm kiếm, xếp hạng lại rồi mới cắt |
| Hướng dẫn hệ thống dài dòng | Đoạn 2.000 token gửi kèm mọi câu hỏi, cả ngày | Rút gọn, và dùng bộ nhớ đệm ngữ cảnh nếu nhà cung cấp hỗ trợ |
| Dùng mô hình mạnh nhất cho mọi việc | Phân loại một câu hỏi ngắn không cần mô hình đắt nhất | Định tuyến: việc dễ dùng mô hình nhỏ, việc khó mới nâng cấp |
Cách ước tính trước khi làm
Công thức tối giản để trình bày với ban giám đốc:
Chi phí tháng ≈ số lượt dùng/tháng × (token vào mỗi lượt × giá vào + token ra mỗi lượt × giá ra).
Điều quan trọng không phải con số cuối, mà là ba kịch bản: mức dùng hiện tại, mức dùng nếu toàn công ty dùng, và mức dùng nếu mở cho khách hàng bên ngoài. Kịch bản thứ ba thường lớn hơn kịch bản đầu vài chục lần, và đó là lúc cần đặt hạn mức.
Bảy cách giảm chi phí mà không giảm chất lượng
- 1Đệm câu trả lời lặp lại. Rất nhiều câu hỏi trùng nhau từng chữ; trả lại kết quả đã lưu là miễn phí.
- 2Định tuyến theo độ khó. Phần lớn lượt dùng là việc đơn giản, không cần mô hình đắt nhất.
- 3Cắt gọn ngữ cảnh. Bốn đoạn tài liệu đúng tốt hơn hai mươi đoạn cho chắc — vừa rẻ hơn vừa chính xác hơn.
- 4Dùng bộ nhớ đệm ngữ cảnh cho phần hướng dẫn hệ thống không đổi, nếu nhà cung cấp có hỗ trợ.
- 5Gộp xử lý theo lô cho việc không cần trả lời ngay, ví dụ phân loại chứng từ hằng đêm.
- 6Đặt giới hạn độ dài trả lời. Không cần ba đoạn văn khi một câu là đủ.
- 7Đo trước khi tối ưu. Ghi lại số token của từng loại yêu cầu; gần như luôn có một loại chiếm phần lớn hoá đơn.
So sánh với chi phí đang bỏ ra
Cuối cùng, con số cần so không phải "AI đắt hay rẻ" mà là "so với cách đang làm thì thế nào". Nếu một tính năng tốn vài triệu mỗi tháng nhưng thay được 25–30 giờ công nhập liệu, phép tính rất rõ. Nếu nó tốn vài triệu mỗi tháng để tạo ra một tiện ích thỉnh thoảng có người dùng, thì cũng rất rõ theo chiều ngược lại.
Cần bàn cụ thể?
SealCore khảo sát tại doanh nghiệp bạn và báo giá trọn gói sau buổi đầu tiên — kể cả khi kết luận là bạn chưa cần viết phần mềm riêng.


