通过多模态交互与池化注意力优化RGB-D语义分割
计算机视觉与模式识别
2023-12-07 v2
摘要
RGB-D 图像的语义分割涉及理解场景中物体的外观与空间关系,这需要仔细考量多种因素。然而,在室内环境中,简单输入 RGB 与深度图像往往导致语义与空间信息的获取相对有限,从而产生次优的分割结果。为此,我们提出多模态交互与池化注意力网络(MIPANet),一种旨在利用 RGB 与深度模态间的交互协同、优化互补信息利用的新方法。具体而言,我们将多模态交互融合模块(MIM)嵌入网络的最深层。该模块旨在促进 RGB 与深度信息的融合,实现相互增强与校正。此外,我们在编码器的各阶段引入池化注意力模块(PAM)。该模块用于放大网络提取的特征,并以针对性方式将模块输出整合进解码器,显著提升了语义分割性能。我们的实验结果表明,MIPANet 在两个室内场景数据集 NYUDv2 与 SUN-RGBD 上优于现有方法,凸显了其在增强 RGB-D 语义分割方面的有效性。
引用
@article{arxiv.2311.11312,
title = {Optimizing rgb-d semantic segmentation through multi-modal interaction and pooling attention},
author = {Shuai Zhang and Minghong Xie},
journal= {arXiv preprint arXiv:2311.11312},
year = {2023}
}