VITALIFY.ASIA logo

Học tăng cường là gì? Điều gì đã xảy ra phía sau “trận chiến siêu thực” ấy?

Bài viết giải thích học tăng cường qua thí nghiệm robot sumo trên NVIDIA Isaac Sim. Từ State, Action, Environment, Reward đến cơ chế thử và sai, bài viết cho thấy vì sao AI không cần “đáp án mẫu” và có thể tự tìm ra những chiến thuật bất ngờ như lariat, gập tay và không chiến.

Học tăng cường là gì? Điều gì đã xảy ra phía sau “trận chiến siêu thực” ấy?
Nội dung bài viết

Trong bài viết trước, chúng tôi đã chia sẻ quá trình hai robot được huấn luyện đấu sumo bằng NVIDIA Isaac Sim và tiến hóa đầy hỗn loạn theo từng epoch: từ giai đoạn chỉ đứng nhìn nhau cho đến cuối cùng phát triển thành những đòn tấn công trên không.

Trong quá trình quan sát chuyển động của các robot ở thí nghiệm đó, chúng tôi đã có nhiều phát hiện và bài học đáng chú ý về Isaac Sim thực chất là một sản phẩm như thế nào.

Ấn tượng thẳng thắn của chúng tôi là Isaac Sim giống Unity ML-Agents mà công ty từng làm việc cùng khoảng sáu năm trước đến đáng ngạc nhiên.
Về bản chất, các khái niệm và pipeline gồm môi trường, agent, phần thưởng và policy gần như hoàn toàn giống nhau.

So với Unity ML-Agents, Isaac Sim có quy mô và khả năng chạy song song vòng lặp lớn hơn rất nhiều. Tuy nhiên, xét ở khía cạnh cả hai đều là môi trường để vận hành vòng lặp học tăng cường (RL), chúng hoàn toàn có điểm chung.

Lần này, cũng để tự hệ thống lại hiểu biết của mình, chúng tôi muốn tổng hợp bản chất của phương pháp học tăng cường.

Không tồn tại “đáp án đúng” hay mẫu để bắt chước

Học tăng cường là một phương pháp của học máy, nhưng điểm khác biệt lớn so với nhiều phương pháp khác là không tồn tại dữ liệu mẫu chứa hành vi đúng để AI bắt chước.

Ví dụ, trong quá trình học của AI tạo sinh văn bản như LLM, có một chuỗi văn bản “lý tưởng” nên xuất hiện tiếp theo trong một ngữ cảnh nhất định, và AI cố gắng tiến gần nhất có thể tới đáp án đó.

Tuy nhiên, robot sumo hoàn toàn không được cung cấp dữ liệu mẫu về chuyển động khớp hay hướng dẫn rằng “đây là một động tác sumo đẹp”.

Lưu ý: Nói theo hướng ngược lại, nếu chúng ta cho robot sumo xem đáp án đúng và hướng dẫn từng bước “hành động tiếp theo nên là gì”, tương tự cách đưa ra đáp án trong quá trình học của LLM, thì về lý thuyết có thể tạo ra những robot sumo “ngoan ngoãn” hơn. Chúng tôi sẽ để câu chuyện này cho một dịp khác.

Trong học tăng cường, thứ tồn tại không phải là mẫu để bắt chước, mà chỉ là quy tắc đánh giá — tức bảng tính điểm.

Có mục tiêu, nhưng “không quan trọng dùng cách nào để đạt được”

Vậy một AI không có mẫu để bắt chước sẽ học như thế nào?

Câu trả lời là thử và sai.

Nói một cách đơn giản và hơi thô một chút, nó giống như một trò chơi “chết để học”.

Với những người không thường xuyên chơi game, cách diễn đạt này có thể còn khó hiểu hơn, vì vậy xin giải thích trước: “trò chơi chết để học” là kiểu game mà người chơi phải chết rất nhiều lần, học từ từng thất bại và dần ghi nhớ cách vượt qua thử thách.

Ngược lại, học có giám sát (SL) không giống kiểu “chết để học”, mà gần với việc học thuộc các đề thi cũ hơn. Đây có thể xem là một đặc điểm thể hiện sự khác biệt căn bản giữa hai phương pháp.

Học tăng cường = “game siêu khó, không gợi ý, phải chết để học”

Quá trình học tăng cường rất giống việc bị bắt chơi các game của FromSoftware như Elden Ring hay Dark Souls trong trạng thái bịt mắt và không có sách hướng dẫn.

Không có mẫu để làm theo
Không ai nói cho người chơi biết đâu là cách di chuyển đúng.

Chết để học (thử và sai)
Người chơi — tức AI — tự bước vào bẫy, rơi khỏi vách đá, bị boss hạ gục chỉ bằng một đòn, tức liên tục nhận hình phạt. Bằng cách tích lũy dữ liệu từ chính những thất bại của mình, AI dần tự xây dựng các mẫu chiến thuật như “à, không nên bước vào chỗ này” hay “phải né ở thời điểm này”.

Robot sumo tiến hóa từ việc chỉ đứng nhìn nhau đến chiến đấu trên không cũng vì chúng chỉ có thể tìm ra con đường chiến thắng sau khi “chết” — tức rơi khỏi võ đài — hàng chục nghìn lần.

Có thể nói đây chính là cực hạn của một “trò chơi chết để học”.

Học tăng cường luôn vận hành theo vòng lặp sau:

  • Trạng thái (State): Tư thế hiện tại của robot và khoảng cách tới đối thủ
  • Hành động (Action): Cách robot di chuyển các khớp
  • Môi trường (Environment): Không gian vật lý trong Isaac Sim
  • Phần thưởng (Reward): “Điểm số” hoặc “hình phạt” nhận được từ kết quả của hành động

Mệnh lệnh mà AI nhận được về cơ bản chỉ là:

“Hãy đạt tổng số điểm — tức phần thưởng — cao nhất có thể.”

Nói cách khác: “Mục tiêu là điểm số cao đã được xác định, nhưng con đường hay phương pháp để đạt tới đó không bị quy định. Hãy tự tìm ra bằng cách thử và sai.”

Vì sao cuối cùng lại trở thành “không chiến”?

Chính đặc điểm “không quan trọng dùng cách nào” này là nguyên nhân dẫn đến quá trình tiến hóa hỗn loạn mà chúng ta đã thấy.

Con người sẽ nghĩ: “Đây là sumo, vậy hãy đẩy đối thủ ra khỏi võ đài.”

Nhưng với một AI không có mẫu để bắt chước, không tồn tại khái niệm về “tinh thần sumo” hay “lẽ thường của con người”.

Đối với AI, đáp án đúng chỉ đơn giản là kiếm được điểm nhanh và hiệu quả nhất trong phạm vi luật đã đặt ra.

Sau quá trình thử và sai, những chiến thuật AI tìm ra bao gồm:

  • Gập hai tay ra sau lưng vì tiếp xúc bằng tay có thể khiến bản thân mất thăng bằng
  • Tung lariat vì đây là cách nhanh chóng làm đối thủ ngã
  • Đá đối thủ lên cao, đưa ma sát về 0 và giành quyền kiểm soát hoàn toàn

Đó là những cách “hack vật lý” cực đoan mà con người khó nghĩ ra.

Khoảnh khắc chúng tôi nhận ra rằng: “Chúng ta tưởng mình đang dạy robot sumo, nhưng AI thực ra đang giải nó như một trò chơi săn điểm cao bằng các định luật vật lý”, mọi chuyển động kỳ lạ của robot bỗng trở nên hợp lý.

Kết luận: Sự khó khăn và thú vị khi truyền đạt ý định của con người cho AI

Qua thí nghiệm này, chúng tôi cảm nhận rất rõ cả sự thú vị lẫn độ khó của học tăng cường: để AI tự thử và sai chỉ dựa trên các quy tắc, mà không cung cấp một đáp án đúng.

AI không hề thất bại.

Nó chỉ đang kiên trì khai thác những khoảng trống trong luật mà chúng ta đặt ra và tìm kiếm con đường dẫn tới chiến thắng.

Việc nhận ra rằng chiều sâu — và cả sự hỗn loạn — của học tăng cường, nơi AI có thể tạo ra những hành vi vượt xa trí tưởng tượng của con người, vẫn hiện diện nguyên vẹn ngay cả trong Isaac Sim là một thu hoạch lớn đối với chúng tôi, đồng thời cũng mang lại cảm giác khá hoài niệm.

Trong bài tiếp theo, chúng tôi dự định thử nghiệm thiết kế phần thưởng (reward engineering): cần đặt ra những quy tắc và phần thưởng như thế nào để các robot này có thể đấu sumo “đẹp”, đúng với ý định của con người?

Đừng để ý tưởng chỉ nằm trên giấy. Với tốc độ và sự linh hoạt đã được chứng minh qua 1.000+ dự án, chúng tôi sẽ giúp doanh nghiệp của bạn bứt phá.

Quay lại Blog

Bài viết liên quan

I'm Duper, ask me anything!