中文

DCANet:用于 RGB-D 语义分割的差分卷积注意力网络

图像与视频处理 2022-10-18 v1 计算机视觉与模式识别

摘要

在过去几年中,在语义分割中结合 RGB 图像与相应的深度图证明了其有效性。现有的 RGB-D 模态融合方法要么缺乏非线性特征融合能力,要么平等对待两种模态图像,而忽略内在分布差异或信息损失。在此我们发现,由于其局部深度连续性,深度图适合提供物体的内在细粒度模式,而 RGB 图像有效地提供全局视图。基于此,我们提出像素差分卷积注意力(DCA)模块,以考虑深度数据的几何信息与局部范围相关性。此外,我们将 DCA 扩展为集成差分卷积注意力(EDCA),其传播长程上下文依赖并无缝结合 RGB 数据的空间分布。DCA 和 EDCA 通过像素差动态调节卷积权重,以分别在局部和长程实现自适应。我们提出一个由 DCA 和 EDCA 构建的双分支网络,称为差分卷积网络(DCANet),以融合双模态数据的局部与全局信息。因此,RGB 和深度数据的各自优势得到强调。我们的 DCANet 在两个具挑战性的基准数据集(即 NYUDv2 和 SUN-RGBD)上展示了 RGB-D 语义分割的新最先进性能。

关键词

引用

@article{arxiv.2210.06747,
  title  = {DCANet: Differential Convolution Attention Network for RGB-D Semantic Segmentation},
  author = {Lizhi Bai and Jun Yang and Chunqi Tian and Yaoru Sun and Maoyu Mao and Yanjun Xu and Weirong Xu},
  journal= {arXiv preprint arXiv:2210.06747},
  year   = {2022}
}