中文

基于双 Swin-Transformer 的互交互网络用于 RGB-D 显著目标检测

计算机视觉与模式识别 2022-06-08 v1

摘要

显著目标检测(Salient Object Detection)是预测给定场景中人类注意区域的一项任务。已有研究证明融合深度信息在该任务中行之有效。该问题的主要挑战在于如何聚合来自 RGB 模态与深度模态的互补信息。然而,传统深度模型严重依赖 CNN 特征提取器,通常忽略了长程上下文依赖。本工作中,我们提出基于双 Swin-Transformer 的互交互网络(Dual Swin-Transformer based Mutual Interactive Network)。我们采用 Swin-Transformer 作为 RGB 与深度模态的特征提取器,以建模视觉输入中的长程依赖。在将两支特征融合为一之前,应用基于注意力的模块增强各模态特征。我们设计了基于自注意力的跨模态交互模块与门控模态注意力模块,以利用两模态间的互补信息。对于显著性解码,我们构建了具有密集连接的不同阶段,并在同时考虑多级编码特征时保持解码记忆。考虑到深度图不准确的问题,我们收集早期阶段的 RGB 特征送入跳跃卷积模块,以从 RGB 模态向最终显著性预测提供更多引导。此外,我们加入边缘监督以正则化特征学习过程。在五个标准 RGB-D SOD 基准数据集上基于四种评估指标的综合实验证明了所提 DTMINet 方法的优越性。

关键词

引用

@article{arxiv.2206.03105,
  title  = {Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient Object Detection},
  author = {Chao Zeng and Sam Kwong},
  journal= {arXiv preprint arXiv:2206.03105},
  year   = {2022}
}