中文

VDAWorld:通过VLM引导的抽象与仿真进行世界建模

计算机视觉与模式识别 2025-12-15 v1

摘要

生成式视频模型作为世界建模的前沿方法,面临着根本性的局限。它们经常违反物理和逻辑规则,缺乏交互性,并且作为不透明的黑盒运行,不适合构建结构化、可查询的世界。为克服这些挑战,我们提出了一种新范式,专注于将图像标题对蒸馏为一种易于处理、针对仿真优化的抽象表示。我们引入了VDAWorld,这是一个框架,其中视觉语言模型(VLM)充当智能体来编排这一过程。VLM从一套视觉工具中进行选择,自主构建一个有根据的(2D或3D)场景表示,并相应地选择一个兼容的物理仿真器(如刚体、流体)对其进行操作。然后,VDAWorld可以从静态场景中推断潜在动力学,以预测合理的未来状态。我们的实验表明,这种智能抽象与自适应仿真的结合产生了一个多功能的世界模型,能够在广泛的动态场景中产生高质量的仿真。

关键词

引用

@article{arxiv.2512.11061,
  title  = {VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation},
  author = {Felix O'Mahony and Roberto Cipolla and Ayush Tewari},
  journal= {arXiv preprint arXiv:2512.11061},
  year   = {2025}
}

备注

Website: https://felixomahony.github.io/vdaworld/