中文

HERMES:用于同时进行 3D 场景理解与生成的统一自驾世界模型

计算机视觉与模式识别 2025-08-14 v3

摘要

驾驶世界模型(DWMs)已成为自动驾驶中不可或缺的技术,因其能够实现未来场景预测。然而,现有的 DWMs 仅限于场景生成,未能融合场景理解这一功能——后者涉及对驾驶环境的解释与推理。在本文中,我们提出了名为 HERMES 的统一驾驶世界模型。我们通过在驾驶场景中构建统一框架,无缝集成 3D 场景理解与未来场景演化(生成)。具体而言,HERMES 利用鸟瞰视图(BEV)表示整合多视角空间信息,同时保留几何关系和相互作用。我们还引入了世界查询(world queries)机制,通过大语言模型中的因果注意力将世界知识注入 BEV 特征,从而为理解与生成任务提供上下文丰富。我们在 nuScenes 和 OmniDrive-nuScenes 数据集上进行了全面实验,以验证方法的有效性。HERMES 实现了领先的性能,将生成误差降低 32.4%,并提升了理解指标中的 CIDEr 指标提升 8.0%。该模型和代码将在 https://github.com/LMD0311/HERMES 上公开。

关键词

引用

@article{arxiv.2501.14729,
  title  = {HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation},
  author = {Xin Zhou and Dingkang Liang and Sifan Tu and Xiwu Chen and Yikang Ding and Dingyuan Zhang and Feiyang Tan and Hengshuang Zhao and Xiang Bai},
  journal= {arXiv preprint arXiv:2501.14729},
  year   = {2025}
}

备注

Accepted by ICCV 2025. The code is available at https://github.com/LMD0311/HERMES