导语
过去行业习惯把"世界模型"与"VLA"视作两条竞争路线,2026 年这一二分法基本瓦解。主流判断是:世界模型是 VLA 体系的核心组成部分,而非替代品——模型先在内部"预演"动作的后果,再据此生成动作。NVIDIA 把这一范式概括为 WAM(World Action Model,世界动作模型),其训练逻辑与语言模型高度同构:预训练预测下一个世界状态,动作微调校准对真实机器人有用的部分,最后由强化学习完成最后一里路。更重要的工程副产品是:视频预测对了,动作通常就对;视频开始幻觉,动作往往就失败——这为真实部署提供了一条可观测的失败预警通道。
技术要点
从"预测像素"到"预测状态"。 世界模型的底层能力来自大规模视频生成模型的副产品:通过预测下一帧像素,模型自发学会了重力、浮力、光照、遮挡等物理规律的表征。PEVA(NeurIPS 2025,LeCun 团队)以条件扩散 Transformer 从全身物理动作预测第一视角视频;DreamDojo(ICML 2026,NVIDIA)从大规模人类视频训练通用机器人世界模型,支持环境交互与动作预测;Genie Envisioner(ICLR 2026)把世界基础平台与操作统一。
WAM:把动作与未来状态一起解码。 NVIDIA DreamZero 同时解码"下一刻世界状态"与"下一步动作",把动作视作与像素同类的连续信号,实现零样本的新任务迁移。其经验观察具有直接工程价值:视频预测质量与动作成功率高度相关,因此可以把视频预测的一致性作为策略置信度的代理指标。
反思与边界开始出现。 Fast-WAM(arXiv 2026)直接追问"世界动作模型是否真的需要测试时的未来想象",对"必须想象才能行动"的假设提出质疑;"Do World Action Models Generalize Better than VLAs?"(arXiv 2026)则从鲁棒性角度做系统对比。这类工作说明该方向已进入"去泡沫"阶段。
工业侧落地。 Cortex 2.0(arXiv 2026)聚焦把世界模型落到真实工业部署中;小鹏在 CVPR 2026 公开世界模型技术蓝图,提出审慎推理、可控生成、长时程预测三大能力;中科第五纪 FAM-1.3 在执行前生成多视角未来视频供操作员预览,显著提升不安全动作的拦截率。
关键突破
- •世界模型从"生成任务"变成"控制组件":subgoal image provider(子目标图像生成)成为可插拔模块,π0.7 首次将其集成进 VLA。
- •获得同源的失败预警信号:视频预测与动作生成共享表征,使得"想象崩坏"可提前预示"动作失败",这是安全部署的关键抓手。
- •对人类视频的依赖加深:DreamDojo、EgoScale、Being-H0.7 等工作均以大规模人类第一视角视频为主要预训练语料,进一步抬高了第一视角数据的战略地位。
- •出现对必要性的实证质疑:Fast-WAM 等工作提醒业界,测试时的显式想象可能并非必需,推理预算有限时应优先保证控制频率。
对产业的影响
第一,世界模型把"数据的时间一致性"推到了更关键的位置。预测下一帧需要输入帧之间严格等时、视角关系稳定;若采集数据存在时间抖动或视角跳变,世界模型学到的将是错误的动力学。这直接抬高了硬件同步与标定的价值。
第二,"可预览"正在成为人机协同的新界面。操作员通过预览机器人"以为会发生什么"来否决不安全动作,这比事后复盘更高效,也为数据供应商提供了新的产品形态——交付数据的同时交付"可用于世界模型训练的时序一致性报告"。
第三,训练语料向人类第一视角视频倾斜,意味着采集成本结构成为竞争要素。谁能以更低单位成本提供更大规模、时序严格对齐的第一视角数据,谁就在 WAM 路线中占据上游。
配图建议
图 1(放置:导语之后)
- •画面描述:WAM 的三段式训练示意(对应语言模型三步法):① Pre-train:海量人类视频 → "Next world state prediction";② Action Fine-tune:少量真机数据 → 校准到可执行动作;③ RL:真实/仿真环境 → 策略优化。三段用渐变色带连接,每段下方标注对应语言模型阶段(next token prediction / SFT / RL)。
- •图注:图 1|世界动作模型(WAM)的训练范式与语言模型三步法同构(范式归纳参考 NVIDIA 公开演讲,2026)。
图 2(放置:"关键突破"第二条之后)
- •画面描述:上下对照的双轨图。上轨"视频预测正确":连续三帧预测画面与目标帧高度吻合,右侧动作轨迹平滑、任务成功;下轨"视频预测幻觉":预测画面出现物体位置漂移/重影,右侧动作轨迹抖动、任务失败。中间用"预测一致性 ↔ 动作成功率"的相关性箭头连接。
- •图注:图 2|视频预测质量与动作成功率的相关性——"想象崩坏"可作为失败预警信号(相关性强弱依任务而异,属经验观察)。
图 3(放置:"对产业的影响"第一条之后)
- •画面描述:时序一致性对世界模型训练的影响对照。左:严格等时的多视角帧序列,动力学学习正常;右:存在时间抖动与视角跳变的同序列,预测出的未来帧出现重影与位置漂移。底部标注"同步误差 → 动力学偏差 → 策略失败"。
- •图注:图 3|时间一致性是世界模型训练的前置条件,硬件同步误差会直接转化为动力学偏差。
来源与时间
- •NVIDIA《Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models》技术博客(2026),整理引用 DreamZero、Fast-WAM、Being-H0.5/H0.7、Xiaomi-robotics-0、Cortex 2.0 等。
- •DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos(ICML 2026)。
- •EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data(ICML 2026)。
- •PEVA: Predicting Egocentric Video with Whole-Body Physical Actions(NeurIPS 2025,LeCun 团队)。
- •Genie Envisioner(ICLR 2026);SparseWorld-TC(CVPR 2026,Oral)。
- •小鹏在 CVPR 2026 公开世界模型技术蓝图;中科第五纪 FAM-1.3 多视角未来视频预览(2026,公开报道)。
标注说明:"视频预测质量 ↔ 动作成功率"的相关性来自工程经验观察,缺乏跨任务的系统性统计,属推测性结论;各模型的具体指标以原始论文为准(待核实)。