中文

Skip Mamba扩散模型用于单目三维语义场景补全

计算机视觉与模式识别 2025-01-14 v1 人工智能

摘要

三维语义场景补全对于自主系统中的多个下游任务至关重要。它估计所获取场景数据中缺失的几何和语义信息。由于现实世界条件具有挑战性,该任务通常需要处理多模态数据的复杂模型才能达到可接受的性能。我们提出了一种独特的神经模型,利用状态空间和扩散生成建模的进展,通过单目图像输入实现了卓越的三维语义场景补全性能。我们的技术在变分自编码器的条件潜在空间中处理数据,其中使用创新的状态空间技术进行扩散建模。我们神经网络的一个关键组成部分是所提出的Skimba(Skip Mamba)去噪器,它擅长高效处理长序列数据。Skimba扩散模型是我们三维场景补全网络的核心,包含三重Mamba结构、维度分解残差以及沿三个方向的可变膨胀。我们还采用了该网络的一个变体用于我们方法的后续语义分割阶段。在标准SemanticKITTI和SSCBench-KITTI360数据集上的广泛评估表明,我们的方法不仅大幅优于其他单目技术,而且与立体方法相比也达到了竞争性能。代码可在https://github.com/xrkong/skimba获取。

关键词

引用

@article{arxiv.2501.07260,
  title  = {Skip Mamba Diffusion for Monocular 3D Semantic Scene Completion},
  author = {Li Liang and Naveed Akhtar and Jordan Vice and Xiangrui Kong and Ajmal Saeed Mian},
  journal= {arXiv preprint arXiv:2501.07260},
  year   = {2025}
}

备注

Accepted by AAAI 2025