中文

目标力:教会视频模型完成基于物理条件的目标

计算机视觉与模式识别 2026-03-24 v2 人工智能 机器人学

摘要

视频生成领域的最新进展使得能够模拟机器人和规划潜在未来的“世界模型”得以发展。然而,为这些模型指定精确的目标仍然是一个挑战;文本指令通常过于抽象,无法捕捉物理细节,而目标图像对于动态任务来说往往难以指定。为了解决这个问题,我们引入了Goal Force,这是一个新颖的框架,允许用户通过显式的力向量和中间动力学来定义目标,模仿人类概念化物理任务的方式。我们在一个由合成因果基元(如弹性碰撞和倒下的多米诺骨牌)构成的精心策划的数据集上训练了一个视频生成模型,教会它在时间和空间中传播力。尽管仅在简单的物理数据上训练,我们的模型对复杂的现实世界场景表现出显著的零样本泛化能力,包括工具操作和多物体因果链。我们的结果表明,通过将视频生成建立在基本物理相互作用的基础上,模型可以成为隐式的神经物理模拟器,从而在不依赖外部引擎的情况下实现精确的、物理感知的规划。我们在项目页面上发布了所有数据集、代码、模型权重和交互式视频演示。

关键词

引用

@article{arxiv.2601.05848,
  title  = {Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals},
  author = {Nate Gillman and Yinghua Zhou and Zitian Tang and Evan Luo and Arjan Chakravarthy and Daksh Aggarwal and Michael Freeman and Charles Herrmann and Chen Sun},
  journal= {arXiv preprint arXiv:2601.05848},
  year   = {2026}
}

备注

Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/