中文

使用视觉语言世界模型进行推理规划

人工智能 2025-09-09 v2

摘要

有效的规划需要强大的世界模型,但能够理解和对动作进行语义和时间抽象推理的高级世界模型仍然 severely 缺乏发展。我们引入了视觉语言世界模型(Vision Language World Model, VLWM),这是一款针对自然视频进行语言-based world modeling 训练的基础模型。给定视觉观察,VLWM 首先推断整体目标实现情况,然后预测由交错动作和世界状态变化组成的轨迹。这些目标通过迭代 LLM Self-Refine 提取,条件于压缩的未来观察表示,这些表示由 Tree of Captions 表示。VLWM 学习一个动作策略和一个动态模型,分别促进反应性 system-1 计划解码和反思性 system-2 规划通过最小化成本。该成本评估 VLWM roll-outs 给定的假设未来状态与预期目标状态之间的语义距离,并通过我们在自监督方式下训练的批评家模型来衡量。VLWM 在两个基准评估和我们提出的 PlannerArena 人类评估中实现了视觉规划助理(Visual Planning for Assistance, VPA)的最先进水平,其中 system-2 在 system-1 基础上提升了 +27% 的 Elo 分数。VLWM 模型在 RoboVQA 和 WorldPrediction 基准测试中也优于强大的 VLM 框架。

关键词

引用

@article{arxiv.2509.02722,
  title  = {Planning with Reasoning using Vision Language World Model},
  author = {Delong Chen and Theo Moutakanni and Willy Chung and Yejin Bang and Ziwei Ji and Allen Bolourchi and Pascale Fung},
  journal= {arXiv preprint arXiv:2509.02722},
  year   = {2025}
}