中文

X-Drive:驾驶场景下跨模态一致的多传感器数据合成

计算机视觉与模式识别 2024-11-05 v1

摘要

最近的进展利用扩散模型合成驾驶场景中的 LiDAR 点云或相机图像数据。尽管它们在建模单模态数据边缘分布方面取得了成功,但不同模态之间相互依赖关系以描述复杂驾驶场景的研究仍未被充分探索。为填补这一空白,我们提出了一种新颖框架 X-DRIVE,通过双分支潜在扩散模型架构来建模点云和多视角图像的联合分布。考虑到两种模态不同的几何空间,X-DRIVE 使每种模态的合成依赖于另一种模态的对应局部区域,从而确保更好的对齐性和真实性。为进一步处理去噪过程中的空间模糊性,我们设计了基于极线的跨模态条件模块来自适应学习跨模态局部对应关系。此外,X-DRIVE 允许通过多层次输入条件进行可控生成,包括文本、边界框、图像和点云。大量结果证明了 X-DRIVE 在点云和多视角图像方面的高保真合成结果,在遵循输入条件的同时确保了可靠的跨模态一致性。我们的代码将在 https://github.com/yichen928/X-Drive 公开发布。

关键词

引用

@article{arxiv.2411.01123,
  title  = {X-Drive: Cross-modality consistent multi-sensor data synthesis for driving scenarios},
  author = {Yichen Xie and Chenfeng Xu and Chensheng Peng and Shuqi Zhao and Nhat Ho and Alexander T. Pham and Mingyu Ding and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2411.01123},
  year   = {2024}
}