中文

SyntheOcc:通过3D语义多平面图像合成几何可控的街景图像

计算机视觉与模式识别 2024-10-02 v1

摘要

自动驾驶的进步高度依赖于带标注的数据集,尤其是在3D占用率预测任务中,其占用率标签需要密集的3D标注,耗费大量人力。在本文中,我们提出了SyntheOcc,这是一种扩散模型,通过在驾驶场景中利用占用率标签作为条件,合成逼真且几何可控的图像。这为训练感知模型和仿真等应用提供了无限量的、多样化的、带标注的且可控的数据集。SyntheOcc解决了如何高效地将3D几何信息编码为2D扩散模型的条件输入这一关键挑战。我们的方法创新性地采用3D语义多平面图像(MPIs)来提供全面且空间对齐的3D场景描述作为条件。因此,SyntheOcc能够生成与给定几何标签(3D体素空间中的语义)忠实对齐的逼真多视角图像和视频。在nuScenes数据集上对SyntheOcc进行的广泛定性和定量评估证明了其在生成可控占用率数据集方面的有效性,这些数据集可作为感知模型的有效数据增强手段。

关键词

引用

@article{arxiv.2410.00337,
  title  = {SyntheOcc: Synthesize Geometric-Controlled Street View Images through 3D Semantic MPIs},
  author = {Leheng Li and Weichao Qiu and Yingjie Cai and Xu Yan and Qing Lian and Bingbing Liu and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2410.00337},
  year   = {2024}
}