中文

UniDrive-WM:面向自动驾驶的统一理解、规划与生成世界模型

计算机视觉与模式识别 2026-03-24 v3

摘要

世界模型已成为自动驾驶的核心,其中准确的场景理解和未来预测对安全控制至关重要。近期工作探索了使用视觉语言模型进行规划,但现有方法通常将感知、预测和规划作为独立模块处理。我们提出了 UniDrive-WM,一种统一的基于 VLM 的世界模型,它在单一架构内联合执行驾驶场景理解、轨迹规划和轨迹条件的未来图像生成。UniDrive-WM 的轨迹规划器预测未来轨迹,以此条件化基于 VLM 的图像生成器来产生合理的未来帧。这些预测提供了额外的监督信号,增强了场景理解并迭代地优化了轨迹生成。我们进一步比较了未来图像预测的离散和连续输出表示,分析了它们对下游驾驶性能的影响。在具有挑战性的 Bench2Drive 基准上的实验表明,UniDrive-WM 生成了高保真度的未来图像,并且与之前最佳方法相比,在 L2 轨迹误差上提升了 7.3%,在碰撞率上提升了 10.4%。这些结果证明了紧密集成 VLM 驱动的推理、规划和生成式世界建模对自动驾驶的优势。项目页面可在 https://unidrive-wm.github.io/UniDrive-WM 获取。

关键词

引用

@article{arxiv.2601.04453,
  title  = {UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving},
  author = {Zhexiao Xiong and Xin Ye and Burhan Yaman and Sheng Cheng and Yiren Lu and Jingru Luo and Nathan Jacobs and Liu Ren},
  journal= {arXiv preprint arXiv:2601.04453},
  year   = {2026}
}

备注

Project Page: https://unidrive-wm.github.io/UniDrive-WM