中文

LOMA:基于 Triplane Mamba 的语言辅助语义占据网络

计算机视觉与模式识别 2024-12-12 v1

摘要

基于视觉的 3D 占据预测因其多样性和经济性而日益受到关注。当前方法通常将图像基视觉特征投影到 3D 空间,通过注意力机制学习几何信息,从而实现 3D 语义占据预测。然而,这些方法面临两个主要挑战:1)几何信息有限。由于图像本身缺乏几何信息,直接预测 3D 空间信息尤其在大规模户外场景中具有挑战性。2)局部受限交互。由于注意力机制的二次复杂度,这些方法常使用修改后的局部注意力来融合特征,导致融合受限。为解决这些问题,本文提出一种语言辅助的 3D 语义占据预测网络,命名为 LOMA。在提出的视觉-语言框架中,我们首先引入 VL-aware 场景生成器(VSG)模块,用于生成场景的 3D 语言特征。通过利用视觉-语言模型,该模块提供隐式的几何知识和显式的语义信息。此外,我们提出了 Tri-plane Fusion Mamba(TFM)模块高效融合 3D 语言特征和 3D 视觉特征。该模块不仅进行全局建模,还避免了过多的计算开销。在 SemanticKITTI 和 SSCBench-KITTI360 数据集上的实验表明,我们的方法在几何完成和语义完成任务上均实现了新的状态最佳性能。我们的代码将很快公开。

关键词

引用

@article{arxiv.2412.08388,
  title  = {LOMA: Language-assisted Semantic Occupancy Network via Triplane Mamba},
  author = {Yubo Cui and Zhiheng Li and Jiaqiang Wang and Zheng Fang},
  journal= {arXiv preprint arXiv:2412.08388},
  year   = {2024}
}

备注

Accepted by AAAI2025