中文

面向场景语义分割的区域增强特征学习

计算机视觉与模式识别 2024-01-18 v3

摘要

复杂场景中的语义分割不仅依赖于物体外观,还依赖于物体位置及其周围环境。然而,由于大规模点云巨大的计算成本,以成对点相关性的形式对长程上下文进行建模十分困难。本文提出使用区域作为点云的中间表示,而非细粒度点或体素,以减轻计算负担。我们引入了一种新颖的区域增强特征学习网络(REFL-Net),利用区域相关性来增强点特征学习。我们设计了一个基于区域的特征增强(RFE)模块,该模块由语义-空间区域提取阶段和区域依赖建模阶段组成。在第一阶段,输入点根据其语义和空间邻近性被分组为一组区域。在第二阶段,我们在区域特征上采用自注意力块来探索区域间的语义与空间关系,然后将点特征与区域特征融合以获得更具判别力的表示。我们提出的 RFE 模块即插即用,可与常见的语义分割骨干网络集成。我们在 ScanNetV2 和 S3DIS 数据集上进行了大量实验,并使用不同的分割骨干网络评估了我们的 RFE 模块。与骨干模型相比,我们的 REFL-Net 在 ScanNetV2 上实现了 1.8% 的 mIoU 提升,在 S3DIS 上实现了 1.7% 的 mIoU 提升,且计算开销可忽略不计。定量和定性结果均表明我们的 REFL-Net 具有强大的长程上下文建模能力和强泛化能力。

关键词

引用

@article{arxiv.2304.07486,
  title  = {Region-Enhanced Feature Learning for Scene Semantic Segmentation},
  author = {Xin Kang and Chaoqun Wang and Xuejin Chen},
  journal= {arXiv preprint arXiv:2304.07486},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Multimedia 2023