中文

Uni-World VLA:面向自动驾驶的交错式世界建模与规划

机器人学 2026-03-31 v1 计算机视觉与模式识别

摘要

自动驾驶需要推理环境如何演化并据此进行规划。现有基于世界模型的方法通常先预测未来场景,再进行规划,导致开环想象与实际决策过程发生漂移。本文提出Uni-World VLA,一种统一的视觉-语言-动作(VLA)模型,紧密交错地进行未来帧预测与轨迹规划。不同于在规划前生成完整的世界滚动, our model 在预测未来帧和自主动作之间交替进行,使规划决策能够持续基于想象的未来观察进行条件化。这种交错生成形式在世界建模与控制之间形成闭环互动,使动态交通情景下的决策更具适应性。此外,我们将单目深度信息融入帧中,为世界建模提供更强的几何线索,提高长期场景预测效果。在NAVSIM基准测试中,我们的方法实现了具竞争力的闭环规划性能,同时产生高保真度的未来帧预测。这些结果表明,紧密耦合世界预测与规划是可扩展VLA驾驶系统的有前景方向。

关键词

引用

@article{arxiv.2603.27287,
  title  = {Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving},
  author = {Qiqi Liu and Huan Xu and Jingyu Li and Bin Sun and Zhihui Hao and Dangen She and Xiatian Zhu and Li Zhang},
  journal= {arXiv preprint arXiv:2603.27287},
  year   = {2026}
}

备注

22 pages, 8 figures. Submitted to ECCV 2026. Code will be released