Mark học AI

Video #53 · AI đa giác quan · Phần 4/6

AI xem và tóm tắt video thế nào? Khung hình và lời thoại

Đưa AI một video dài cả tiếng, vài giây sau đã có bản tóm tắt. Nó xem kiểu gì?

AI xem video kiểu gì?

Phần trước, AI nghe và nói chuyện với bạn như người thật. Giờ đưa nó một video dài cả tiếng. Vài giây sau đã có bản tóm tắt. Nó xem kiểu gì?

KHUNG HÌNH

Video là một xấp ảnh

Video thật ra là một xấp ảnh tĩnh, gọi là khung hình, lật thật nhanh. Mỗi giây thường khoảng 30 tấm, kèm một dải âm thanh song song.

LẤY MẪU

Chỉ nhìn vài khung mỗi giây

Một tiếng video là khoảng 108.000 tấm ảnh. Xem hết thì quá nặng. Nên AI chỉ lấy mẫu: mỗi giây chọn vài khung, có khi chỉ 1 khung.

LỜI THOẠI

Nghe cả lời thoại

Cùng lúc, AI chép lời thoại ra chữ, như cách nó nghe bạn ở phần 1. Khung hình và câu nói đều gắn mốc thời gian, nên AI biết chuyện gì xảy ra ở phút nào.

GHÉP LẠI

Hình cộng lời ra ý chính

Ghép hình với lời, AI nắm được nội dung chính: ai đang nói, đang làm gì, trang trình chiếu nào đang hiện trên màn hình.

ĐIỂM YẾU

Chi tiết lướt nhanh dễ sót

Nhưng vì chỉ nhìn lướt, chuyện xảy ra trong nửa giây có thể lọt giữa hai khung. Một cú sút chớp nhoáng, một dòng chữ nhỏ thoáng qua. AI có thể bỏ sót, thậm chí đoán bừa.

PHẦN 5

AI có làm ra video không?

Xem được video rồi. Vậy AI có tự làm ra video không? Và làm sao nhân vật không biến dạng giữa chừng? Hẹn bạn ở phần 5.

Đây là bài viết từ video AI xem video của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.