中文

OA-CNNs:面向三维语义分割的全自适应稀疏卷积神经网络

计算机视觉与模式识别 2024-03-22 v1

摘要

2020年代三维识别的蓬勃发展始于点云变换器(point cloud transformers)的引入。它们迅速超越了稀疏卷积神经网络(sparse CNNs),成为最先进的模型,尤其是在三维语义分割领域。然而,稀疏卷积神经网络因其效率优势和易于应用的特点,仍然是有价值的网络。在这项工作中,我们重新审视了设计差异,并测试了稀疏卷积神经网络所能达到的极限。我们发现,造成性能差异的关键在于自适应性。具体而言,我们提出了两个关键组件,即自适应感受野(空间上)和自适应关系,以弥合这一差距。这一探索促成了全自适应三维卷积神经网络(Omni-Adaptive 3D CNNs,OA-CNNs)的诞生,这是一个集成了轻量级模块的网络系列,能以最小的计算成本极大增强稀疏卷积神经网络的自适应性。在没有任何自注意力模块的情况下,OA-CNNs 在室内和室外场景的准确率上均显著优于点变换器,且延迟和内存成本低得多。值得注意的是,它在 ScanNet v2、nuScenes 和 SemanticKITTI 验证基准上分别达到了 76.1%、78.9% 和 70.6% 的 mIoU,同时保持比变换器同类方案快至多 5 倍的速度。这一揭示凸显了纯稀疏卷积神经网络超越变换器相关网络的潜力。

关键词

引用

@article{arxiv.2403.14418,
  title  = {OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation},
  author = {Bohao Peng and Xiaoyang Wu and Li Jiang and Yukang Chen and Hengshuang Zhao and Zhuotao Tian and Jiaya Jia},
  journal= {arXiv preprint arXiv:2403.14418},
  year   = {2024}
}

备注

CVPR 2024