World Models, Explained
這集在講什麼
這集在問一個很具體的問題:為什麼 AI 仍然這麼「吃資料」——人類學下棋、開車、打球常常幾次就會,模型卻要 tens of thousands 的樣本才有感?主持人用一個錨點把答案講得很清楚:如果你真的有「完美 world model」,理論上就不用一直去環境收樣本,NASA 提前幾年算好小行星軌跡就是活教材。結論不是「只靠 next-token prediction 就夠了」,而是要把 world model、policy、value 與 test-time planning 組合起來;聽完你會帶走一個判斷框架:越接近 chess / Go 這種小 action space、可預測環境,越能靠 MCTS 和 world model 撐住;越到 self-driving、robotics 這種高維、非同步、會互相影響的世界,就越需要 latent compression、action conditioning,甚至更好的 brain-like architecture。",
來賓:Francois Chollet(來賓身份在逐字稿中未明講,但明顯是以 ARC AGI 與 sample efficiency 這條研究線聞名的研究者/思想領先者);他有資格談這題,因為整集的核心命題「intelligence per sample」與「skill acquisition rate」正是他長期推動的觀點;他在這集最核心的主張可以概括成一句話:「真正的智能不是把更多資料背起來,而是更快從更少 sample 學會新技能。」
本集亮點
03:01用 Newton’s second law 和 NASA 追蹤 asteroid 當例子,說明「完美 world model」的理想狀態是幾乎不用再跟環境收樣本;這個比喻直接把抽象的 sample efficiency 變成可操作的工程問題。
08:15把 control problem 拆成 state transition function、policy、reward 三件事,並用 drone landing 的公式一路推到 convex optimization;值得聽的是它把「world model 不是玄學,而是 s_t+1 = f(s_t,a_t)」這件事講得非常具體。
27:41AlphaGo 的 MCTS 不是單純「想很多步」而已,而是每一步大約要做 24,000 次 model invocations 才能決策;這段把 test-time planning 的昂貴程度講到很直白,也順手解釋為什麼 action space 一大就爆炸。
53:16把 World Models、Dreamer、video diffusion / flow matching 串起來:先用大量影像學出 state transition,再加少量 action conditioning,接著在 synthetic rollouts 上訓練 policy;這是整集最實際的路線圖,也最接近現在 robotics 真正能落地的方向。
章節
同節目其他集 看全部 ›
完整逐字稿(可點句跳播)、一集白板、AI 問答與一鍵摘錄,在聽摘裡看 👇
聽摘