中文

用于 RGB-D 显著性目标检测的全局-局部感知双相互学习网络

计算机视觉与模式识别 2025-01-06 v1 多媒体

摘要

RGB-D 显著性目标检测 (SOD) 旨在通过联合建模 RGB 和深度信息来突出给定场景的显著区域,是具有挑战性的像素级预测任务之一。近年来,由于双注意力机制能够增强检测过程,它已被应用于该领域。然而,大多数现有方法在人工强制融合范式下直接融合跨模态注意力特征,而未考虑 RGB 与深度之间的固有差异,这可能导致性能下降。此外,源自全局和局部信息的长程依赖使得难以采用统一高效的融合策略。因此,在本文中,我们提出了 GL-DMNet,一种具有全局-局部感知的新型双相互学习网络。具体而言,我们提出了位置相互融合模块和通道相互融合模块,以挖掘不同模态在空间和通道维度上的相互依赖关系。此外,我们采用基于级联 Transformer 注入重构的高效解码器,联合集成多级融合特征。在六个基准数据集上的大量实验表明,我们提出的 GL-DMNet 优于 24 种 RGB-D SOD 方法,与次优模型 (S3Net) 相比,在四项评估指标上平均提升了约 3%。代码和结果可在 https://github.com/kingkung2016/GL-DMNet 获取。

关键词

引用

@article{arxiv.2501.01648,
  title  = {Dual Mutual Learning Network with Global-local Awareness for RGB-D Salient Object Detection},
  author = {Kang Yi and Haoran Tang and Yumeng Li and Jing Xu and Jun Zhang},
  journal= {arXiv preprint arXiv:2501.01648},
  year   = {2025}
}