中文

用于三维大规模场景理解的长程池化

计算机视觉与模式识别 2023-01-18 v1

摘要

受近期视觉 transformer 与卷积神经网络(CNNs)中大核设计的成功启发,本文分析并探究其成功的关键原因。我们指出对三维大规模场景理解至关重要的两个因素:更大的感受野与具有更强非线性的操作。前者负责提供长程上下文,后者可增强网络容量。为实现上述特性,我们提出一种简单而高效的长程池化(LRP)模块,使用空洞最大池化,为网络提供大的自适应感受野。LRP 参数极少,且可便捷地加入现有 CNNs。此外,基于 LRP,我们给出完整的网络架构 LRPNet 用于三维理解。消融实验支持我们的论断,并表明 LRP 模块比大核卷积取得更好结果且计算量更低,因其非线性。我们还在多个基准上展示了 LRPNet 的优越性:LRPNet 在 ScanNet 上表现最佳,并在 S3DIS 与 Matterport3D 上超越其他基于 CNN 的方法。代码将公开可用。

关键词

引用

@article{arxiv.2301.06962,
  title  = {Long Range Pooling for 3D Large-Scale Scene Understanding},
  author = {Xiang-Li Li and Meng-Hao Guo and Tai-Jiang Mu and Ralph R. Martin and Shi-Min Hu},
  journal= {arXiv preprint arXiv:2301.06962},
  year   = {2023}
}