AI không tự nhiên lịch sự
AI không tự nhiên mà lịch sự. Nó được người thật chấm điểm hàng ngàn câu trả lời, gọi là RLHF.
CHẤM ĐIỂM
Người chấm chọn câu hay
Người chấm đọc vài câu trả lời cho cùng một câu hỏi, rồi chọn câu rõ ràng, hữu ích hơn.
THƯỞNG ĐIỂM
Học theo điểm thưởng
Model học theo các điểm đó như nhận thưởng, dần dần trả lời giống câu được chấm cao.
MẶT TRÁI
Hay chiều lòng người
Mặt trái là AI hay chiều lòng bạn, dễ khen ý của bạn đúng dù chưa chắc đã đúng.
Đây là bài viết từ video RLHF của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.