中文

DriveDreamer-Policy:一种几何驱动的世界-动作模型,用于统一生成与规划

计算机视觉与模式识别 2026-04-03 v1 人工智能 机器人学

摘要

最近,世界-动作模型(WAM)已出现,旨在桥接视觉-语言-动作(VLA)模型与世界模型,统一它们的推理和指令遵循能力以及时空世界建模。然而,现有的 WAM 方法通常侧重于建模 2D 外观或潜在表示,缺乏几何基础——这是物理世界中运行的具身系统的一个基本要素。我们提出了 DriveDreamer-Policy,一个统一的驾驶世界-动作模型,将深度生成、未来视频生成和运动规划集成在一个模块化架构中。该模型使用大型语言模型处理语言指令、多视角图像和动作,随后通过三个轻量级生成器产生深度、未来视频和动作。通过学习几何感知的世界表示并将其用于在统一框架中指导未来预测和规划,所提出的模型产生了更连贯的想象未来和更具信息量的驾驶动作,同时保持了模块化和可控的延迟。在 Navsim v1 和 v2 基准上的实验表明,DriveDreamer-Policy 在闭环规划和世界生成任务上均取得了强劲性能。特别地,我们的模型在 Navsim v1 上达到 89.2 PDMS,在 Navsim v2 上达到 88.7 EPDMS,优于现有的基于世界模型的方法,同时产生了更高质量的未来视频和深度预测。消融研究进一步表明,显式深度学习为视频想象提供了互补益处,并改善了规划鲁棒性。

关键词

引用

@article{arxiv.2604.01765,
  title  = {DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning},
  author = {Yang Zhou and Xiaofeng Wang and Hao Shao and Letian Wang and Guosheng Zhao and Jiangnan Shao and Jiagang Zhu and Tingdong Yu and Zheng Zhu and Guan Huang and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2604.01765},
  year   = {2026}
}

备注

11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/