中文

DreamPlan:基于视频世界模型的视觉语言规划器高效强化微调

机器人学 2026-03-18 v1

摘要

机器人操作需要 sophisticated 的常识推理能力,这是大规模视觉语言模型(VLM)天然具备的能力。虽然 VLM 在零样本规划方面显示出前景,但其缺乏扎实的物理理解,往往导致在复杂真实环境中出现累积性错误和低成功率,尤其是针对刚需操作等具挑战性任务。虽然强化学习(RL)可将这些规划器适配到具体任务动态,但直接通过真实交互微调 VLM 代价高昂、unsafe 且样本效率低。为克服这一瓶颈,我们引入 DreamPlan,一种通过视频世界模型对 VLM 规划器进行强化微调的新框架。不依赖昂贵的物理滚动,我们首先利用零样本 VLM 收集探索性交互数据。我们展示,这些亚最优数据足以训练一个基于动作条件的视频生成模型,从而隐式地捕获复杂的真实世界物理。随后,在该视频世界模型的“想象”中,通过 Odds Ratio Policy Optimization(ORPO)对 VLM 规划器进行微调。通过利用这些虚拟滚动,将物理知识和任务特定知识有效注入 VLM。我们的结果表明,DreamPlan 在语义推理与物理 grounding 之间搭建了桥梁,显著提升了操作成功率,且无需大规模真实世界数据收集。我们的项目页面为 https://psi-lab.ai/DreamPlan/。

关键词

引用

@article{arxiv.2603.16860,
  title  = {DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models},
  author = {Emily Yue-Ting Jia and Weiduo Yuan and Tianheng Shi and Vitor Guizilini and Jiageng Mao and Yue Wang},
  journal= {arXiv preprint arXiv:2603.16860},
  year   = {2026}
}