Model quá nặng
Mark tải thử một model mở, như video 1 trăm mười bốn, nhưng file nặng tới mười sáu GB, laptop báo hết bộ nhớ.
QUANTIZATION
Làm tròn các con số
Bit giải thích: model là hàng tỷ con số. Quantization, tức lượng tử hóa, là làm tròn các con số đó cho gọn hơn. Lưu mỗi số bằng bốn bit thay vì mười sáu bit, model nhẹ đi khoảng bốn lần.
VÍ DỤ
Giống nén ảnh
Giống như nén ảnh khi gửi qua tin nhắn: file nhỏ đi nhiều, mà nhìn vẫn gần như cũ.
ĐỔI LẠI
Mất một chút độ chính xác
Đổi lại, model mất một chút độ chính xác. Bốn bit thường vẫn dùng tốt, nhưng nén quá tay thì model trả lời kém hẳn.
KÝ HIỆU
Đọc tên file
Khi tải model, bạn sẽ thấy ký hiệu như Q4 hay Q8. Đó là số bit sau khi nén: số càng nhỏ, file càng nhẹ.
Đây là bài viết từ video Quantization, nén model cho vừa laptop của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.