Mark học AI

Video #130 · AI chạy trên máy bạn · Phần 2/3

Quantization là gì? Cách nén model AI cho vừa laptop

Tải một model mở về máy mà file nặng tới 16 GB, laptop báo hết bộ nhớ? Bit giải thích quantization (lượng tử hóa):

Model quá nặng

Mark tải thử một model mở, như video 1 trăm mười bốn, nhưng file nặng tới mười sáu GB, laptop báo hết bộ nhớ.

QUANTIZATION

Làm tròn các con số

Bit giải thích: model là hàng tỷ con số. Quantization, tức lượng tử hóa, là làm tròn các con số đó cho gọn hơn. Lưu mỗi số bằng bốn bit thay vì mười sáu bit, model nhẹ đi khoảng bốn lần.

VÍ DỤ

Giống nén ảnh

Giống như nén ảnh khi gửi qua tin nhắn: file nhỏ đi nhiều, mà nhìn vẫn gần như cũ.

ĐỔI LẠI

Mất một chút độ chính xác

Đổi lại, model mất một chút độ chính xác. Bốn bit thường vẫn dùng tốt, nhưng nén quá tay thì model trả lời kém hẳn.

KÝ HIỆU

Đọc tên file

Khi tải model, bạn sẽ thấy ký hiệu như Q4 hay Q8. Đó là số bit sau khi nén: số càng nhỏ, file càng nhẹ.

Đây là bài viết từ video Quantization, nén model cho vừa laptop của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.