面向场景语义分割的区域增强特征学习
计算机视觉与模式识别
2024-01-18 v3
摘要
复杂场景中的语义分割不仅依赖于物体外观,还依赖于物体位置及其周围环境。然而,由于大规模点云巨大的计算成本,以成对点相关性的形式对长程上下文进行建模十分困难。本文提出使用区域作为点云的中间表示,而非细粒度点或体素,以减轻计算负担。我们引入了一种新颖的区域增强特征学习网络(REFL-Net),利用区域相关性来增强点特征学习。我们设计了一个基于区域的特征增强(RFE)模块,该模块由语义-空间区域提取阶段和区域依赖建模阶段组成。在第一阶段,输入点根据其语义和空间邻近性被分组为一组区域。在第二阶段,我们在区域特征上采用自注意力块来探索区域间的语义与空间关系,然后将点特征与区域特征融合以获得更具判别力的表示。我们提出的 RFE 模块即插即用,可与常见的语义分割骨干网络集成。我们在 ScanNetV2 和 S3DIS 数据集上进行了大量实验,并使用不同的分割骨干网络评估了我们的 RFE 模块。与骨干模型相比,我们的 REFL-Net 在 ScanNetV2 上实现了 1.8% 的 mIoU 提升,在 S3DIS 上实现了 1.7% 的 mIoU 提升,且计算开销可忽略不计。定量和定性结果均表明我们的 REFL-Net 具有强大的长程上下文建模能力和强泛化能力。
引用
@article{arxiv.2304.07486,
title = {Region-Enhanced Feature Learning for Scene Semantic Segmentation},
author = {Xin Kang and Chaoqun Wang and Xuejin Chen},
journal= {arXiv preprint arXiv:2304.07486},
year = {2024}
}
备注
Accepted by IEEE Transactions on Multimedia 2023