World Models 101
目录
01

人们说的是什么

阅读约 13 分钟 · 可交互

这个词如今至少涵盖五种不同的东西,而使用它的人很少说清是哪一种。在你读下一篇相关论文之前,先用这份指南把它们分开。

一段短片划过你的时间线。有人正用方向键在一片风景里行走,说明写着这是生成出来的,不是搭出来的。它看起来像一款没人做过的电子游戏。

底下的回复叫它世界模型。于是你去查了查这个词。

先点击画面,然后用方向键或 WASD。

Fig. 1.1这不是录像。山脊线是在被画出来的那一刻从你的朝向算出来的,画面背后并没有存着一片风景。把开关关掉,走开再回到标记这里;然后打开开关,再走一次。

十分钟以后,你开了五个标签页,它们描述的是五台不同的机器。一台生成你可以用方向键操控的视频。一台把几何结构导出到 Blender。还有一篇论文讲的是预测视频嵌入向量,而它从头到尾没给你看过一段视频。

这不是研究上的失败。大约在 2018 到 2024 年之间,计算机视觉、强化学习、机器人学和可解释性研究都伸手拿了同样这两个字,而且每一方描述的都是真实存在的东西。到了 2026 年,各个实验室开始出版词典。

Fig. 1.2这里每一项都是你可以打开的真实产物,而且每一项都被造出它的人称作世界模型。先顺着链接看看。看过它们之间共同点有多少之后,这一章会好读得多。

这一章我会讲清楚目前在用的五种定义、每一种是从哪里来的,以及那个能把它们分开的测试。第 2 到 6 章讲底下的机制。

源头

这个词有一个很具体的出处。在控制理论里,后来在强化学习里,世界模型指的是一个学出来的转移函数:给它一个状态和一个动作,它给你下一个状态。

写下来是这样:

p(,)

在给定 的条件下,

把鼠标移到公式的任意部分,或下面的任意短语上。

Fig. 1.3这就是全部对象。这一章里每一个系统,本质上都是在争论 s 的位置上该放什么:像素、几何、一个紧凑向量,还是一个嵌入向量。正是这一个选择把五种定义分了开来。

卡尔曼 1960 年的滤波器把其中一半做得极漂亮:从带噪声的测量里推算出隐藏状态(它估计状态,但从来不问「如果我采取行动会怎样」,所以它是前身而不是成员)。1990 年前后,Schmidhuber 造出了分成两部分的神经系统:一个网络给世界建模,另一个选择动作,而前者预测后者的选择会带来什么。Sutton 的 Dyna 做的是相关的另一件事,它在「从真实经验里学」和「从模型编出来的经验里学」之间交替。

Ha 与 Schmidhuber 的《World Models》(2018)让这个说法流行了起来。他们的系统有三个部件:一个编码器(一个把视频帧压成一小串数字的网络)、一个预测这串数字接下来往哪走的动力学模型,以及一个几乎完全在模型自己想象出来的推演里训练出来的小控制器。

PlaNet(2018)直接从像素里学到这套动力学,并在潜在空间里做规划(「潜在」的意思就是模型自己的压缩描述:几百个数字,而不是上百万个像素)。Dreamer(2019)用同一套机制,从想象出来的轨迹里学出行为。

后来这个词开始迁移。JEPA 不再预测下一帧长什么样,而是开始预测它的一个摘要。Genie、Cosmos 和 Marble 则朝相反方向走,走向你能看见、能走进去的世界。四条传统,各自握着同一个问题的不同一块。直到输出开始彼此相像,它们才发现自己原来是邻居。

动作观测编码器状态估计动力学(给定)解码器预测控制器

通过运行一个前向模型、并用观测到的结果去修正它,从带噪声的测量里恢复出隐藏状态。动力学是给定的,不是学出来的,而且这里没有任何东西会问「如果我采取行动会怎样」。

Fig. 1.4拖动年份。一路上没有任何东西被替换掉,只是被添加、改名或者换了目标,而这正是为什么出于完全不同理由造出来的系统最后共用了一个名字。

五种定义

这些是合同,不是笼子。它们描述一个系统承诺了什么,而现代的工作经常在它们之间来回跨越。

按预测对象排序

更具体  ←   被预测的是什么  →  更抽象

它不是一个可运行的系统

这个词被用来指五种东西。其中四种是你可以运行的系统;第五种是关于系统内部有什么的断言。任选其一。

Fig. 1.5其中四种是你可以运行的系统,按被预测对象的抽象程度排列。第五种根本不是系统,所以它不在这条轴上。任选其一。

渲染器预测观测,通常是像素。GameNGen 以先前的帧和你的输入为条件生成 DOOM 的画面。据报道,Genie 3 能以 720p、每秒 24 帧生成可交互视频,能保持数分钟的连贯,还能接受会话中途的自然语言干预:换天气,加一群鸟。一致性是存在的,但它是通过生成学出来的,而不是由存下来的几何结构保证的。

仿真器预测可查询的结构。Marble 接收文字、一张图或者一个粗糙的三维布局,一次返回两种表示。高斯泼溅(几百万个彩色斑点,渲染起来便宜,但没有任何东西可以撞上去)负责外观。三角网格负责结构,其中包括碰撞网格(物理引擎真正会撞上去的那层看不见的几何)。World Labs 在 2025 年 11 月开放了限量测试,2026 年 2 月正式发布。英伟达开源了 Cosmos,它生成有物理感的视频,专门用作机器人和自动驾驶的训练数据。

Cosmos 是那个让整张地图保持诚实的例子,值得放慢速度看一看。英伟达把 Cosmos Predict 描述为生成式视频,而显式的三维仿真由 Omniverse 提供。把整个平台归到「仿真器」名下,你就把最值得学的那条区别藏起来了。

更广的教训是:平台不是一个类别。一个产品可以同时提供一个像素预测器、一个三维仿真器和一个以动作为条件的模型,而问「它到底属于五种里的哪一种」不会有结果。要问的是:他们卖给你的是哪一份合同,你即将对着哪一个接口开发。类别描述的是合同,而足够大的系统会同时签好几份。

渲染器 / 预测观测

Google DeepMindGenie 3: Creating dynamic worlds that you can navigate in real-time

仿真器 / 预测结构

World LabsIntroducing Marble by World Labs
Fig. 1.6这不是及格与不及格之分。Marble 交给你的几何结构,别的程序可以打开,你自己就能验证;Genie 3 的连贯性是造它的实验室报告出来的,你没法验证。区别在于各自承诺了什么,以及其中有多少是你能核实的。

动力学模型预测在动作条件下的紧凑状态和回报。PlaNet 在潜在空间里做在线规划;Dreamer 从穿过这套动力学想象出来的轨迹里学出行为。这里重要的不是它看起来有多真,而是你能不能在里面做搜索:试一百条可能的动作序列,给它们打分,留下最好的那条。

关于这个名字要提醒一句,因为它会绊倒之后去读原论文的人。Ha 与 Schmidhuber 的系统有三个模块,他们把第三个叫做 controller,也就是那个挑选动作的小策略。世界模型是它旁边的那个模块,是 controller 在里面做规划的东西。所以这一类指的是模型,不是控制器;把这一类叫做「控制器」,等于用那个明确不是世界模型的部件去给它命名。

表征模型预测嵌入向量(一串代表一张图或一段片子的数字,排列方式使得相似的东西彼此靠近),然后把预测扔掉。I-JEPA 遮住图像的一部分,预测缺失部分的嵌入向量,而不是把像素重画出来。V-JEPA 2 在超过一百万小时的视频上做预训练,全程不涉及动作。第二阶段再后训练出一个以动作为条件的变体,用于模型预测控制(规划几步,执行一步,再重新规划)。Meta 报告说它能驱动一只从未在训练中见过的实验室里的 Franka 机械臂,并且规划速度比 Cosmos 快约 30 倍。把这个数字看作不同合同之间的比较,而不是一个排名。

注意第二阶段落在了哪里。以动作为条件、可以往前推演、可以在上面做搜索:这就是动力学模型的合同,只不过是从另一个方向抵达的。而这正是这些类别的用处。它们描述的是一个系统被训练来预测什么,而不是一种永久身份,成熟的系统会迁移。V-JEPA 2 从表征模型出发,在它上面长出了一个动力学模型。

内隐模型是另一种性质的断言。它讲的不是一个系统,而是在为完全别的目的训练出来的网络内部形成了什么。

最典型的结果是 Othello-GPT:一个只被训练来预测合法黑白棋走法、从未见过棋盘的 transformer,结果在内部表示了棋盘状态。这个表示可以被探针(一个小分类器,训练它从网络的激活值里读出某一个具体事实)读出来。对这个表示做干预,会改变模型接下来走的棋。Nanda 等人(2023)后来发现了一个与之密切相关的线性表示。没有人给这个模型一个叫做 world_model 的可调用函数。这个说法描述的是关于「别的系统内部出现了什么」的证据。

那个测试

你已经做过它了。

图 1.1 里有一个开关,写着保持世界不变。把它关掉,走开再回来,标记已经移动了。把它打开,标记就恰好停在你离开时的位置。

这看起来提供了一个区分这些系统的简单办法。

转过身。走开。转回来。还是同一个房间吗?

它应该管用才对。真正在内部持有一个世界的东西,应该能把家具留在你离开时的位置。只会画画的东西,应该做不到。

它不管用,而原因值得花一分钟。

通过这个测试有两条路。你可以把房间存在某个地方,等观看者转回来时再查出来,我那个开关做的就是这件事。或者你可以把「画出一个和刚才那一帧相符的房间」这件事练到非常非常好。

从外面看,这两条路一模一样。家具两种情况下都还在,而站在你的位置上,没有任何你能看见的东西告诉你刚才发生的是哪一种。

一个在大量视频上训练出来的大模型,学到的是第二条路。没有人给它一个房间去保管。它只是变得很擅长把已经开了头的东西继续下去,而保持一致正是「继续下去」的一部分。

所以这个问题没法用来分类。但还是要问,因为它指向的东西比它给出的答案更有用。

当你转身背对那把椅子,椅子并没有停止存在。它只是停止可见。这是两件不同的事,而这门课里几乎所有困难的东西都住在它们之间的缝隙里。

实际存在的那一整套,叫做状态。你此刻能看到的那一部分,叫做观测

状态是世界底层的实际情况;原则上是完整的,但对身处其中的任何智能体都不会直接可见。观测则是智能体对那份实际情况的局部视角。

World Labs 谈这套分类底下的那条区别 (A Functional Taxonomy of World Models, 2026 年 6 月)

你永远拿不到状态。你拿到的是观测,然后必须从它们往回推。你背后的椅子、镜头外还在滚动的球、柜门是开是关:全都真实存在,全都看不见。从看得见的那一部分推出其余部分,这件事叫做部分可观测性,而第 2 到 6 章基本上都在讲怎么应付它。

这些都不是新问题。1943 年,一位剑桥的心理学家就描述过解法,那时还没有任何可以拿来实现它的东西。

如果有机体在头脑中携带着一个关于外部现实、以及关于自身可能行动的「小尺度模型」,它就能够试验各种不同的方案,判断其中哪一个最好,在未来的情境到来之前就作出反应……并且在方方面面都以更充分、更安全、更胜任的方式,去应对摆在它面前的紧急状况。

Kenneth Craik 谈内部模型,比任何人训练出一个早了四十年 (The Nature of Explanation, 1943)

在头脑里带着一个世界的小模型,你就能在真正采取一个行动之前先试一试。这就是全部的想法,而地图上每一种定义,都是在赌这个模型里该装什么。

那个回路

有一个对象垫在全部五种定义底下。

环境有一个状态。智能体收到只揭示了其中一部分的观测。它从观测和记忆里构造出一个内部状态。一个模型预测事情可能怎样演变。智能体采取行动。世界发生变化。新的观测到来。

观测推断预测选择干预 · 世界已经不同了世界隐藏状态 sₜ观测oₜ信念内部状态 bₜ想象可能的未来动作aₜ

每一种定义都专精于这个回路上的某一段。把鼠标移到任意一个上面。

Fig. 1.7智能体与环境的回路,其中每一种定义都被显示为回路上某一段的专家。这就是为什么看上去互不相容的系统会继承同一个名字。

有三个问题直接从这里长出来,每一个都对应一章。

它该有多确定? 把一个球扔到墙后面,然后问它现在在哪里。一个精确的位置是错误形状的答案,因为你确实无从知道。它可能撞到了什么东西,可能停在了路缘上,也可能还在滚。一个把单个确定坐标交还给你的模型,悄悄丢掉了「它其实是在猜」这件事。

PlaNet 的做法是同时携带两样东西。一个确定性部分(每次都用同样的方式算出来,所以它总是从上一个状态推出)承载那些可靠地从先前推出的东西。一个随机性部分(是采样出来的而不是算出来的,所以同样的输入可以产生好几种不同的未来)承载那些仍然可能往任一边走的东西。不确定不是失败。没有依据的确定才是。

你的动作会改变答案吗? 接下来会发生什么如果我推它一下会发生什么是两个不同的问题。只有第二个才让你在选择之前比较不同的选项。能回答它的模型叫做以动作为条件的模型(它被告知采取了哪个动作,所以它能回答「如果」,而不只是「接下来」),而这正是控制所需要的。

它能往前推多远? 一次预测很少就够了。要做规划,模型必须把自己的答案重新喂回去,再预测一次,再一次,全都叠在它刚刚编出来的东西上面。你要求的步数叫做预测步长

p(st, at)p(,)

把要问的东西从 换成,而你手里仍然只有 的条件下,

只有两处发生了变化。把鼠标移到任意一边看看是哪两处。

Fig. 1.8同一个模型,被要求的不是一步,而是一整段未来。有两样东西变大了,有一样没有,全部困难都在这一行里。

误差沿着这一段堆积起来。任何单独一步都没有出什么大事,而这正是它难以察觉的原因:模型永远只是稍微错一点。第一步稍微错一点,第二十步就可能到完全不同的地方去了。

目前还看不出差别。

已预测步数

1

当前偏差

0.0 个步宽

至今最大偏差

0.0 个步宽

Fig. 1.9两个点从同一个位置出发,遵循同一套规则,只不过其中一个跑的动力学参数差了几个百分点。拖到 8 左右,它们还在一起。继续拖。没有任何一步是断裂的;那个差距是累积出来的。

Dreamer 的存在就是为了跨越许多想象出来的步骤去学出行为。DeepMind 则把长时程一致性列为生成世界的一个核心开放问题。同一个敌人,战场的两端。

现在回到那段短片。它是一个渲染器,而且你现在说得出为什么:它预测观测,它之所以能留住那个房间是因为它学会了这么做,而它内部没有任何东西承诺底下有几何结构。

下一段划过你时间线的短片,也会被叫做世界模型。有用的问题不是它是否令人惊艳,而是它属于五种里的哪一种,以及发帖的人说不说得出来。

只在五种中的某一种下成立的说法,这门课会说明是哪一种。

试试看

1 / 13得分 0

它接收一张厨房的照片,输出一个可以导入游戏引擎的网格,台面上还带有碰撞体。

这属于哪一种定义?

Fig. 1.10十三道题,覆盖整章:既包括给这一章从未点名的系统归类,也包括那些图本来就是为了讲清楚的想法。其中有一道是陷阱,而这个错误值得在这里犯,而不是在会议上。

多谢阅读。第 2 章会完整讲动力学模型:一个学出来的模拟器是什么,有了它能换来什么,以及这个想法为什么已经八十岁了却直到最近才好用起来。

参考来源

Fig. 1.11排序是为了方便在此基础上继续做东西,而不是为了历史完整性。全程优先采用第一手材料。