中文

Genesis:具有时空与跨模态一致性的多模态驾驶场景生成

计算机视觉与模式识别 2025-06-23 v4

摘要

我们提出了Genesis,一个用于联合生成具有时空与跨模态一致性的多视角驾驶视频和激光雷达序列的统一框架。Genesis采用两阶段架构,集成了基于DiT的视频扩散模型与3D-VAE编码,以及一个基于BEV感知的激光雷达生成器,该生成器采用基于NeRF的渲染和自适应采样。两种模态通过共享的潜在空间直接耦合,实现了视觉域和几何域之间的连贯演化。为了用结构化语义引导生成过程,我们引入了DataCrafter,一个基于视觉语言模型构建的字幕模块,提供场景级和实例级监督。在nuScenes基准上的大量实验表明,Genesis在视频和激光雷达指标上均达到了最先进的性能(FVD 16.95, FID 4.24, Chamfer 0.611),并有益于包括分割和3D检测在内的下游任务,验证了生成数据的语义保真度和实际效用。

关键词

引用

@article{arxiv.2506.07497,
  title  = {Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency},
  author = {Xiangyu Guo and Zhanqian Wu and Kaixin Xiong and Ziyang Xu and Lijun Zhou and Gangwei Xu and Shaoqing Xu and Haiyang Sun and Bing Wang and Guang Chen and Hangjun Ye and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2506.07497},
  year   = {2025}
}