Mới hơn chưa chắc hợp hơn
Hãng AI vừa ra model mới, nhanh hơn, rẻ hơn. Đội làm chatbot ngân hàng muốn đổi ngay. Khoan. Mới hơn chưa chắc đã hợp hơn.
EVAL SET
Đề thi riêng của sản phẩm
Họ có sẵn một bộ đề, gọi là eval set: vài trăm câu hỏi thật của khách, kèm câu trả lời mong muốn, và cả những câu dụ dỗ từng gặp.
REGRESSION TEST
Cũ và mới cùng làm bài
Model mới phải làm lại toàn bộ đề cũ, rồi chấm điểm so với model đang chạy. Việc này gọi là regression test.
LLM AS A JUDGE
AI chấm, người kiểm
Chấm vài trăm câu bằng tay thì lâu, nên họ dùng một AI làm giám khảo, gọi là LLM as a judge, chấm theo tiêu chí rõ ràng, rồi người kiểm lại những câu khó.
BẤT NGỜ
Giỏi hơn, nhưng tụt chỗ quan trọng
Kết quả có khi bất ngờ: model mới giỏi hơn chín mươi câu, nhưng tụt ở năm câu về phí thường niên. Chưa sửa xong năm câu đó, thì chưa đổi.
KHÔNG CHỈ MODEL
Sửa gì cũng thi lại
Không chỉ đổi model. Sửa một chữ trong prompt, thêm một tài liệu, cũng phải thi lại. Khác với benchmark ở series chấm điểm, eval set này là của riêng sản phẩm đó.
PHẦN SAU
Có chuyện thì lần lại bằng gì
Đổi xong, chạy thật rồi. Có chuyện thì lần lại bằng gì? Phần sáu: logging và tracing.
Đây là bài viết từ video Evaluation: thi lại trước khi đổi model của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.