编辑|杨文 2026 年,「世界模型」是 AI 圈最没有共识的词之一。 一段能够连续生成的视频,被叫作世界模型;一个随键鼠操作实时变化的数字环境,也被叫作世界模型;在潜空间预测未来状态的系统,以及直接输出机器人动作的策略,同样使用这个名字。 这些模型都在处理世界的信息,能力边界却相去甚远。生成视频里的画面可以足够逼真,却违背真实的物理规律;机器人能够完成一次抓取,也可能只熟悉实验室里的物体、机位和动作轨迹。一个系统究竟学到了视觉相关性、物理结构,还是行动与结果之间的关系,仅靠 Demo 很难回答。 概念混乱增加了技术判断的难度 。画质、几何精度、预测能力和任务成功率被混在一起比较,不同团队看似争夺同一赛道,实际回答的可能是不同问题。 因此,世界模型研究开始回到一个基本问题,模型需要具备哪些能力,才能从生成内容走向理解并改变世界? 李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器,分别输出像素、世界状态与动作。 链接:https://www.worldlabs.ai/blog/taxonomy-of-world-models LeCun 则主张在抽象潜空间中学习可预测的世界结构,让模型保留对理解、推理和规划有用的信息。 链接:https://ai.meta.com/research/vjepa/ 清华大学朱军给出了第三个角度。早在去年 12 月 Motus 发布时,他就公开阐述「通用世界模型」整体构想,今年 3 月,他又将其定位为连接数字世界与物理世界的基础。几个月后,朱军及团队在论文《General World Models from First-Principles》中进一步完善这套框架, 从第一性原理定义核心能力,并给出一张五级进化路线图 技术报告:https://www.shengshu.com/zh/general-world-model/ 论文将通用世界模型的核心能力归纳为 理解、想象和行动 。模型需要从历史观测中形成对当前世界的判断,推演不同选择可能产生的未来,采取行动,再用新观测修正自身。 沿着这一框架,视频生成、实时交互、潜空间预测和机器人控制可被视为同一条能力路线上的不同阶段。 世界模型距离通用智能还有多远,也被转化成更具体的问题 :它能否维持一个连贯的世界?能否预测干预带来的后果?能否从真实反馈中学习?又能否逐渐形成目标并组织更复杂的行动? 世界模型的第一性原理 很多人都有过学自行车的经验。 刚开始时,身体总会摇摇晃晃。看到车把偏向一侧,感觉身体重心开始下沉,人会随即调整方向,再根据新的反馈继续修正。随着练习增加,大脑逐渐学会预判某个动作将带来什么结果。 这正是世界模型最朴素的含义。 1943 年,Kenneth Craik 提出,人类会在头脑中形成关于现实的「小尺度模型」,借此推演不同行动可能带来的结果。强化学习中的 POMDP 进一步描述了这个过程,智能体接收局部观测,估计世界状态,采取动作,再根据新观测更新判断。 朱军团队将这一逻辑概括为通用世界模型的三项核心能力,它们相互衔接,构成持续更新的闭环: 理解(Understanding) :把视觉、语言、声音、触觉或机器人传感器等信息,整合成对当前世界的内部判断; 想象(Imagination) :从当前状态推演多个可能未来,尤其是「如果我采取动作 A,而不是动作 B,结果会怎样」; 行动(Action) :把预测变成对数字或物理环境的干预,并让行动后的新观察反过来检验、修正模型。 通用世界模型的三项核心能力形成一个闭环:理解负责推断当前状态,想象负责预测可能的未来,行动则改变世界,并为下一轮理解提供新的证据。 这也是为什么,视频生成不等于世界模型的全部。 视频模型可以回答接下来画面可能是什么样,但要走向通用世界模型,它还需要回答「如果我改变这个条件、移动这个物体、施加这个动作,世界会如何不同?」 这类带有行动条件的预测,才触及了因果、反事实和可执行决策。 理解、想象、行动,如何形成闭环? 为描述世界模型如何演进,朱军团队进一步提出五级路线,即从 L1 生成世界、L2 交互世界和 L3 在世界中行动,逐步走向 L4 自主世界智能体与 L5 世界组织者。 用一只被推到桌边的玻璃杯来理解,会更直观。 L1 的模型可以生成杯子滑落、撞击、碎裂的连续画面;L2 的模型可以在用户改了视角、改变推动方向后继续演化这个世界;到了 L3,模型需要判断杯子是否要掉落、预测伸手是否来得及,并输出机器人真正可以执行的抓取动作。只有行动后,它才会知道自己对杯子的重量、摩擦和抓取时机判断得是否正确。 再往上,L4 不再只等人给指令,它要能发现风险、主动观察、补充信息,并在失败后修正策略。L5 则进一步面对多主体协作,比如谁去抓杯子、谁去避障、谁来调配工具
发表评论