中文

通过统一视觉与运动表示构建场景生成与规划之间的桥梁:基于世界模型的驾驶

计算机视觉与模式识别 2026-03-17 v1

摘要

端到端自动驾驶旨在从原始传感器输入生成安全且合理的规划策略。驾驶世界模型通过预测驾驶场景的未来演化展现出学习丰富表征的巨大潜力。然而,现有的驾驶世界模型主要聚焦于视觉场景表征,而运动表征未被明确设计为与规划器共享和可继承,导致视觉场景生成与精确运动规划优化之间的鸿沟。我们提出WorldDrive框架,构建性地通过统一视觉与运动表示将场景生成与实时规划耦合。首先,我们引入基于轨迹的驾驶世界模型,利用轨迹词汇表确保视觉动态与运动意图的一致性,从而实现以特定轨迹为条件生成多样且合理未来场景的能力。我们将视觉编码器和运动编码器迁移至下游多模态规划器,确保驾驶策略在由场景生成预优化的成熟表征上运行。运动表征、视觉表征与自车状态之间的简单交互即可生成高质量的多模态轨迹。此外,为充分利用世界模型的前瞻性,我们提出面向未来的奖励器,从冻结的世界模型中提炼未来潜在表征,以实时评估和选择最优轨迹。在NAVSIM、NAVSIM-v2和nuScenes基准测试中进行的大量实验表明,WorldDrive在视觉方法中实现领先的规划性能,同时保持高保真度受动作控制的视频生成能力,为通过统一视觉与运动表征实现稳健自动驾驶提供了有力证据。

关键词

引用

@article{arxiv.2603.14948,
  title  = {Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation},
  author = {Xingtai Gui and Meijie Zhang and Tianyi Yan and Wencheng Han and Jiahao Gong and Feiyang Tan and Cheng-zhong Xu and Jianbing Shen},
  journal= {arXiv preprint arXiv:2603.14948},
  year   = {2026}
}

备注

16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive