中文

UniDriveDreamer:面向自动驾驶的单阶段多模态世界模型

计算机视觉与模式识别 2026-02-03 v1

摘要

世界模型已在自动驾驶的数据合成中展现出巨大的潜力。然而,现有方法主要专注于单模态生成,通常要么生成多摄像机视频,要么生成激光雷达序列。本文提出 UniDriveDreamer,一种用于自动驾驶的单阶段统一多模态世界模型,直接生成多模态未来观察,无需依赖中间表示或级联模块。我们的框架引入了针对激光雷达序列的 LiDAR 特化变分自编码器(VAE),以及用于多摄像机图像的视频 VAE。为确保跨模态兼容性和训练稳定性,我们提出了统一潜在锚定(ULA),显式对齐两种模态的潜在分布。对齐后的特征被融合并由扩散变换器处理,联合建模几何对应关系和时间演化。此外,结构化的场景布局信息被投影到每个模态作为条件信号,以引导合成。广泛的实验表明,UniDriveDreamer 在视频和激光雷达生成任务上均优于先前的最新方法,同时也在下游任务中取得可衡量的改进。

关键词

引用

@article{arxiv.2602.02002,
  title  = {UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving},
  author = {Guosheng Zhao and Yaozeng Wang and Xiaofeng Wang and Zheng Zhu and Tingdong Yu and Guan Huang and Yongchen Zai and Ji Jiao and Changliang Xue and Xiaole Wang and Zhen Yang and Futang Zhu and Xingang Wang},
  journal= {arXiv preprint arXiv:2602.02002},
  year   = {2026}
}

备注

16 pages, 7 figures