面向自主驾驶的统一多模态传感器生成
计算机视觉与模式识别
2025-12-17 v1
摘要
自主驾驶取得了显著的进展,主要归功于大规模的真实数据收集。然而获取多样且边界情况数据仍昂贵且效率低下。生成模型作为合成逼真传感器数据而涌现,成为一个有前景的解决方案。然而,现有方法主要关注单模态生成,导致效率低下且多模态传感器数据对齐不一致。为解决这些挑战,我们提出了OminiGen,在统一框架中生成对齐的多模态传感器数据。我们的方法利用共享的鸟瞰视角(BEV)空间统一多模态特征,设计了一种新型可泛化的多模态重建方法UAE,以联合解码LiDAR和多视图摄像头数据。UAE通过体积渲染实现多模态传感器解码,实现准确且灵活的重建。此外,我们将扩散转换器(DiT)与ControlNet分支集成,以实现可控的多模态传感器生成。我们的全面实验表明,OminiGen在保持多模态一致性和灵活传感器调整方面,实现了理想的统一多模态传感器数据生成性能。
引用
@article{arxiv.2512.14225,
title = {OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving},
author = {Tao Tang and Enhui Ma and xia zhou and Letian Wang and Tianyi Yan and Xueyang Zhang and Kun Zhan and Peng Jia and XianPeng Lang and Jia-Wang Bian and Kaicheng Yu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2512.14225},
year = {2025}
}
备注
ACM MM 2025