同一條高速公路,這次沒有人開。車會越開越快,活越久 = 越厲害。 AI 一開始一直撞,靠獎勵慢慢學會閃車——看它每回合閃過的車數越爬越高。
AI 沒有人教它「怎麼閃」。它只知道:平安往前 = +1 分、撞到車 = -10 分。 它看眼前狀況(最近那台車在我左邊還右邊、有多近),一直試(試錯), 把「這個狀況做這個動作好不好」記在分數表(Q 表)裡,下次選分數高的。 獎勵 + 試錯 + 累積經驗,就是強化學習。
📌 它能撞 100 次、1000 次都不怕,因為這是虛擬環境、可以無限重生—— 真實世界訓練自駕車就是這樣:先在電腦裡開幾百萬公里再上路。
5.1 是你用臉開、5.2 是 AI 自己開,用同一個分數(閃過幾台車)—— 去 5.1 玩玩看,你的最佳成績贏得過 AI 嗎?
AI 在虛擬公路學得很好,但它學到的,到真實馬路一定一樣嗎?真實有行人、有它沒練過的狀況。 哪些情況可以交給 AI、哪些要人盯著?自駕車撞到人,責任算誰的?
🚀 想訓練更複雜的關卡、玩真正的 RL 平台嗎?問問老師有沒有進階版。