AI xem video kiểu gì?
Phần trước, AI nghe và nói chuyện với bạn như người thật. Giờ đưa nó một video dài cả tiếng. Vài giây sau đã có bản tóm tắt. Nó xem kiểu gì?
KHUNG HÌNH
Video là một xấp ảnh
Video thật ra là một xấp ảnh tĩnh, gọi là khung hình, lật thật nhanh. Mỗi giây thường khoảng 30 tấm, kèm một dải âm thanh song song.
LẤY MẪU
Chỉ nhìn vài khung mỗi giây
Một tiếng video là khoảng 108.000 tấm ảnh. Xem hết thì quá nặng. Nên AI chỉ lấy mẫu: mỗi giây chọn vài khung, có khi chỉ 1 khung.
LỜI THOẠI
Nghe cả lời thoại
Cùng lúc, AI chép lời thoại ra chữ, như cách nó nghe bạn ở phần 1. Khung hình và câu nói đều gắn mốc thời gian, nên AI biết chuyện gì xảy ra ở phút nào.
GHÉP LẠI
Hình cộng lời ra ý chính
Ghép hình với lời, AI nắm được nội dung chính: ai đang nói, đang làm gì, trang trình chiếu nào đang hiện trên màn hình.
ĐIỂM YẾU
Chi tiết lướt nhanh dễ sót
Nhưng vì chỉ nhìn lướt, chuyện xảy ra trong nửa giây có thể lọt giữa hai khung. Một cú sút chớp nhoáng, một dòng chữ nhỏ thoáng qua. AI có thể bỏ sót, thậm chí đoán bừa.
PHẦN 5
AI có làm ra video không?
Xem được video rồi. Vậy AI có tự làm ra video không? Và làm sao nhân vật không biến dạng giữa chừng? Hẹn bạn ở phần 5.
Đây là bài viết từ video AI xem video của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.