Viết xong chưa gửi ngay
AI đã viết xong câu trả lời. Nhưng chưa được gửi ngay. Nó phải qua output guardrails, rào chắn cổng ra.
KIỂM 1
Có hứa bừa không
Kiểm tra thứ nhất: có hứa điều chính sách không cho không. Như video 61, một hãng hàng không đã phải đền vì chatbot bịa chính sách hoàn tiền. Guardrails so câu trả lời với tài liệu chính sách, câu nào không có nguồn thì gạch.
KIỂM 2
Lộ, thô, nguy hiểm
Kiểm tra thứ hai: có lộ thông tin người khác không, có câu nào thô lỗ hay nguy hiểm không.
KIỂM 3
Có citation
Kiểm tra thứ ba: câu trả lời có citation, tức dẫn nguồn, đúng tài liệu không. Có nguồn, khách tự kiểm được.
HUMAN IN THE LOOP
Người bấm xác nhận
Còn việc thật, như mở khóa thẻ hay chuyển tiền, AI chỉ chuẩn bị. Người dùng phải tự bấm xác nhận, có khi còn cần nhân viên duyệt. Cách này gọi là human in the loop.
HAI CỔNG
Như an ninh sân bay
Hai cổng cộng lại như an ninh sân bay: soi lúc vào, kiểm lúc ra. Một cổng sót, cổng kia còn bắt được.
PHẦN SAU
Đổi model có vỡ?
Guardrails đặt xong. Nhưng đổi sang model mới thì có vỡ không? Phần năm: evaluation.
Đây là bài viết từ video Output guardrails: rào chắn cổng ra của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.