Mark học AI

Video #83 · Hậu trường một hệ thống AI · Phần 5/7

Evaluation là gì? Vì sao phải thi lại trước khi đổi model AI

Hãng AI ra model mới, nhanh hơn, rẻ hơn. Đổi ngay được không? Khoan: mới hơn chưa chắc đã hợp hơn.

Theo dõi kênh YouTubeVideo này sắp ra mắt

Mới hơn chưa chắc hợp hơn

Hãng AI vừa ra model mới, nhanh hơn, rẻ hơn. Đội làm chatbot ngân hàng muốn đổi ngay. Khoan. Mới hơn chưa chắc đã hợp hơn.

EVAL SET

Đề thi riêng của sản phẩm

Họ có sẵn một bộ đề, gọi là eval set: vài trăm câu hỏi thật của khách, kèm câu trả lời mong muốn, và cả những câu dụ dỗ từng gặp.

REGRESSION TEST

Cũ và mới cùng làm bài

Model mới phải làm lại toàn bộ đề cũ, rồi chấm điểm so với model đang chạy. Việc này gọi là regression test.

LLM AS A JUDGE

AI chấm, người kiểm

Chấm vài trăm câu bằng tay thì lâu, nên họ dùng một AI làm giám khảo, gọi là LLM as a judge, chấm theo tiêu chí rõ ràng, rồi người kiểm lại những câu khó.

BẤT NGỜ

Giỏi hơn, nhưng tụt chỗ quan trọng

Kết quả có khi bất ngờ: model mới giỏi hơn chín mươi câu, nhưng tụt ở năm câu về phí thường niên. Chưa sửa xong năm câu đó, thì chưa đổi.

KHÔNG CHỈ MODEL

Sửa gì cũng thi lại

Không chỉ đổi model. Sửa một chữ trong prompt, thêm một tài liệu, cũng phải thi lại. Khác với benchmark ở series chấm điểm, eval set này là của riêng sản phẩm đó.

PHẦN SAU

Có chuyện thì lần lại bằng gì

Đổi xong, chạy thật rồi. Có chuyện thì lần lại bằng gì? Phần sáu: logging và tracing.

Đây là bài viết từ video Evaluation: thi lại trước khi đổi model của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.

Theo dõi kênh YouTubeVideo này sắp ra mắt