Mark học AI

Video #200 · Tập đặc biệt #200

Bấm Enter xong, AI làm gì trong 2 giây? Mổ xẻ AI từ A đến Z

Video số 200 của kênh! Mark hỏi AI một câu rất đời thường: mai ra Hà Nội chơi thì trời có lạnh không, nên mang gì? Chỉ 2 giây sau là có câu trả lời. Tập này quay chậm 2 giây đó thành 10 chặng, đi qua gần như mọi thứ kênh đã giải thích suốt 200 tập: context, API, data center, token, embedding, attention, nghĩ nháp, tool calling, đoán chữ, streaming, guardrails và hallucination.

2 giây thành 10 phút

Bạn gõ một câu, bấm Enter, và chỉ hai giây sau AI đã trả lời. Hôm nay là tập đặc biệt thứ hai trăm, và mình sẽ quay chậm hai giây đó thành mười phút, để xem bên trong chuyện gì đang xảy ra. Câu hỏi của Mark rất đời thường: mai ra Hà Nội chơi thì trời có lạnh không, và nên mang theo những gì. Ngón tay vừa chạm phím Enter, đồng hồ bắt đầu chạy.

CHẶNG 1

Câu hỏi không đi một mình

Chặng một, câu hỏi không đi một mình: trước khi gửi, ứng dụng gói kèm những tin nhắn trước đó trong cuộc trò chuyện, cùng một đoạn hướng dẫn ẩn gọi là system prompt, lời dặn của nhà làm ứng dụng mà bạn không nhìn thấy. Tất cả gộp lại thành context, tức là ngữ cảnh. Nhớ cái bàn làm việc trong video 9: AI chỉ biết những gì đang nằm trên bàn, ngoài bàn thì nó không thấy.

CHẶNG 2

Lên mây: API, data center

Chặng hai, lên mây: phong bì bay qua mạng, qua một cánh cửa gọi là API, tới data center, những tòa nhà đầy máy chủ chứa GPU, loại chip chuyên làm phép tính cho AI. Ở cổng vào có input guardrails, rào chắn cổng vào, kiểm tra xem câu hỏi có gì nguy hiểm hay thông tin nhạy cảm. Câu hỏi thời tiết của Mark đi qua dễ dàng.

CHẶNG 3

Cắt mảnh: token

Chặng ba, cắt mảnh: vì AI không đọc chữ giống như cách mình đọc, câu hỏi bị cắt thành những mảnh nhỏ gọi là token, có mảnh là cả một từ, có mảnh chỉ là nửa từ hay một dấu câu. Tiếng Việt có dấu nên thường bị cắt vụn hơn tiếng Anh, cùng một ý mà tốn nhiều token hơn. Mỗi mảnh được gắn một con số, giống số trang trong một cuốn từ điển rất dày.

CHẶNG 4

Bản đồ nghĩa: embedding

Chặng bốn, đặt lên bản đồ nghĩa: mỗi token được đổi thành một dãy số dài, gọi là embedding. Dãy số này giống tọa độ trên một tấm bản đồ khổng lồ, nơi những chữ có nghĩa gần nhau thì nằm gần nhau. Trên bản đồ đó, lạnh nằm cạnh áo khoác và khăn quàng, còn Hà Nội nằm gần Hồ Gươm, phố cổ và mùa thu. Nhờ vậy AI nắm được ý, chứ không chỉ thấy mặt chữ.

CHẶNG 5

Các mảnh nhìn nhau: attention

Chặng năm, các mảnh nhìn nhau: đây là phần quan trọng nhất, gọi là attention, cơ chế chú ý. Mỗi token nhìn sang tất cả các token khác để tìm xem mảnh nào liên quan tới mình nhất. Chữ mang trong câu nên mang theo những gì sẽ chú ý mạnh vào Hà Nội và lạnh, nên AI hiểu Mark cần đồ để đi chơi trời lạnh, chứ không phải mang hàng đi bán. Việc nhìn nhau này lặp lại qua hàng chục lớp, gọi là layers, mỗi lớp hiểu sâu thêm một chút. Hàng tỷ phép nhân chạy song song trên GPU, và tất cả chỉ mất một phần nhỏ của giây.

CHẶNG 6

Nghĩ nháp

Chặng sáu, nghĩ nháp: nhiều model bây giờ là mô hình suy luận, biết viết nháp trước khi trả lời. Nháp của AI lúc này rất thật thà: câu hỏi cần thời tiết ngày mai, mà kiến thức của nó chỉ dừng ở lúc học xong, nên nó không biết.

CHẶNG 7

Cầm công cụ: tool calling

Chặng bảy, cầm công cụ: thay vì đoán bừa, AI viết ra một yêu cầu đặc biệt: gọi công cụ thời tiết, địa điểm Hà Nội, ngày mai, và cách này gọi là tool calling. Điều thú vị là AI không tự chạy công cụ: hệ thống bên ngoài đọc yêu cầu, gọi dịch vụ thời tiết, rồi đặt kết quả lên bàn: mai gió mùa về, nhiệt độ từ mười sáu đến hai mươi bốn độ, chiều có thể mưa nhỏ. Giờ trên bàn đã có dữ liệu thật, và đó cũng là lý do AI có công cụ tìm kiếm trả lời chuyện hôm nay đúng hơn hẳn AI không có.

CHẶNG 8

Đoán chữ đầu tiên

Chặng tám, đoán chữ đầu tiên: đến lúc này AI mới bắt đầu trả lời, và cách nó trả lời là đoán. Nó chấm điểm cho hàng chục nghìn token có thể đứng đầu câu trả lời. Chữ Có được bốn mươi phần trăm, chữ Mai được ba mươi, chữ Theo được mười lăm. Rồi nó bốc một chữ theo tỷ lệ đó, giống quay một vòng quay may mắn có ô to ô nhỏ. Độ ngẫu nhiên này chỉnh bằng temperature, nhiệt độ. Vì có bước bốc thăm này, hỏi cùng một câu hai lần, bạn có thể nhận hai câu trả lời khác nhau.

CHẶNG 9

Lặp lại từng chữ

Chặng chín là lặp lại, cho tới khi trả lời xong. Vòng quay dừng ở chữ Có, chữ đó được nối vào cuối, và cả chuỗi, giờ dài thêm một mảnh, lại chạy qua toàn bộ các lớp attention để đoán mảnh tiếp theo. Câu trả lời cho Mark dài khoảng tám mươi token, tức là cả dây chuyền chạy khoảng tám mươi vòng. Chữ nào xong được gửi ngay về điện thoại, gọi là streaming, nên bạn thấy câu trả lời hiện dần từng chữ như có người đang gõ.

CHẶNG 10

Cổng ra và chỗ có thể sai

Chặng mười, cổng ra: trước khi tới tay bạn, câu trả lời đi qua output guardrails, rào chắn cổng ra, để chặn nội dung độc hại hoặc lộ thông tin. Nhưng rào chắn không kiểm được đúng sai. Nếu không có công cụ thời tiết, AI vẫn sẽ đoán ra một câu nghe rất chắc chắn, chỉ là không dựa trên dữ liệu thật. Đó là hallucination, ảo giác, và nó sinh ra từ chính bước đoán chữ.

2,00 GIÂY

Về tay bạn

Đồng hồ dừng ở hai giây, và màn hình hiện câu trả lời: mai Hà Nội gió mùa về, trời se lạnh, chiều có thể mưa nhỏ, nhớ mang áo khoác, khăn quàng và một chiếc ô gấp. Trong hai giây đó có một phong bì ngữ cảnh, một chuyến bay tới data center, vài chục token, hàng chục lớp attention, một lần gọi công cụ và khoảng tám mươi lần đoán chữ. Mỗi lần như vậy đều tốn điện và tốn tiền, nên các ứng dụng miễn phí thường giới hạn số tin nhắn.

200 video trong một cú Enter

Hai trăm video của kênh, gói lại, chính là cú bấm Enter này, từ token, bản đồ nghĩa, attention, tới tool calling và ảo giác. Cảm ơn bạn đã học cùng Mark và Bit suốt hai trăm tập. Mỗi chặng hôm nay đều có video riêng, danh sách nằm ở phần mô tả.

Đây là bài viết từ video Tập đặc biệt #200: Mổ xẻ cú bấm Enter của kênh Mark học AI. Xem video để thấy phần minh họa bằng hình động.