中文

What-If World:面向具身情境的因果世界模型基准

计算机视觉与模式识别 2026-05-28 v1

摘要

视频生成模型日益被用于作为世界模拟器,以驾驶和机器人操作等任务为例。此时何为重要并非在于单个视频是否看起来正确,而是模型输出在输入变化时是否发生相应变化。我们通过给出两个描述相同场景但仅在一个物理细节上有所差异的提示,检验生成的两个视频是否按物理规律发生 divergence。提示之间的措辞差异在设计上是微小的,因为仅改变一个变量,但正确的物理差异并非如此。一个可能忽略这一点的模型仍可能生成两个各自看起来合理的视频,而现有基准测试逐个评估视频,无法检测到这种失效。我们引入What-If World,包含319对这样的提示配对,基于nuScenes和DROID中的真实帧构建,按六种物理变量的分类组织,这些变量在驾驶和操作情境中通用。每对提示配对采用APEO评分标准,即四部分评估标准:遵循提示(Adherence)、物理一致性(Physics)、保持共享场景(Environment)、以正确差异收场(Outcome)。在九个SOTA模型中,没有系统的评分超过52%,而开源模型集中在28%左右。所有测试的模型在大量因果干预上都未能表现良好,表明在可靠支持行动条件模拟或基于模型的规划方面仍有很大提升空间。在模型得分较好的地方,性能表现与干预的视觉显著性相关,而非其底层物理的可处理性。某些在视觉上微妙的干预得分最低,可达14.2%,而视觉显著的干预可达40.4%。

关键词

引用

@article{arxiv.2605.27589,
  title  = {What-If World: A Causal Benchmark for General World Models in Embodied Scenarios},
  author = {Kunlin Cai and Rui Song and Jinghuai Zhang and Kaiyuan Zhang and Pranav Bodapati and Alicia Yu and Fnu Suya and Mohammad Rostami and Jiaqi Ma and Yuan Tian},
  journal= {arXiv preprint arXiv:2605.27589},
  year   = {2026}
}

备注

38 pages, World Model Benchmark