中文

DriveDreamer4D:基于世界模型的 4D 驾驶场景表示

计算机视觉与模式识别 2024-11-26 v3

摘要

闭环仿真是推进端到端自动驾驶系统的关键。当前的传感器仿真方法,如 NeRF 和 3DGS,主要依赖于与训练数据分布高度一致的条件, largely 局限于正向驾驶场景。因此,这些方法在渲染复杂机动行为(如变道、加速、减速)时面临局限。近期的自动驾驶世界模型研究表明,能够生成多样化驾驶视频具有潜力。然而,这些方法仍受限于 2D 视频生成,本质上缺乏捕捉动态驾驶环境细节所必需的时空一致性。本文引入 DriveDreamer4D,通过利用世界模型先验条件增强 4D 驾驶场景表示。具体而言,我们将世界模型用作数据机器来综合生成新轨迹视频,在其中显式利用结构化条件来控制交通要素的时空一致性。此外,提出了核心数据训练策略,用于促进真实数据与合成数据的融合,以优化 4DGS。迄今为止,DriveDreamer4D 是首个利用视频生成模型来提高驾驶场景下 4D 重建质量的方法。实验结果表明,DriveDreamer4D 在 novel 轨迹视图下显著提升了生成质量,相较于 PVG、S3Gaussian 和 Deformable-GS,FID 指标提升了 32.1%、46.4% 和 16.3%。此外,DriveDreamer4D 大幅提升了驾驶代理人的时空一致性,这通过全面的用户研究以及 NTA-IoU 指标的 22.6%、43.5% 和 15.6% 的相对提升得到验证。

关键词

引用

@article{arxiv.2410.13571,
  title  = {DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation},
  author = {Guosheng Zhao and Chaojun Ni and Xiaofeng Wang and Zheng Zhu and Xueyang Zhang and Yida Wang and Guan Huang and Xinze Chen and Boyuan Wang and Youyi Zhang and Wenjun Mei and Xingang Wang},
  journal= {arXiv preprint arXiv:2410.13571},
  year   = {2024}
}

备注

Project Page: https://drivedreamer4d.github.io