中文

SiaTrans:用于带深度图像分类的 RGB-D 显著性目标检测的连体 Transformer 网络

计算机视觉与模式识别 2022-07-12 v1 机器学习

摘要

RGB-D 显著性目标检测(SOD)利用深度信息处理具有挑战性的场景并获得高质量的显著图。现有的最先进 RGB-D 显著性检测方法绝大多数依赖于直接融合深度信息的策略。尽管这些方法通过各种跨模态融合策略提高了显著性预测的准确性,但一些低质量深度图像提供的错误信息会影响显著性预测结果。为解决此问题,本文提出了一种新颖的 RGB-D 显著性目标检测模型(SiaTrans),它允许在训练 SOD 的同时对深度图像质量进行分类训练。鉴于 RGB 与深度图像在显著物体上的共有信息,SiaTrans 使用具有共享权重参数的连体 Transformer 网络作为编码器,并在批次维度上拼接提取 RGB 与深度特征,在不牺牲性能的情况下节省空间资源。SiaTrans 利用骨干网络(T2T-ViT)中的 Class token 对深度图像质量进行分类,同时不阻碍 token 序列继续执行显著性检测任务。基于 Transformer 的跨模态融合模块(CMF)能有效融合 RGB 与深度信息。并且在测试过程中,CMF 可根据深度图像的质量分类信号选择融合跨模态信息或增强 RGB 信息。我们设计的 CMF 与解码器的最大优势在于它们保持了 RGB 与 RGB-D 信息解码的一致性:测试时 SiaTrans 根据分类信号在同一模型参数下解码 RGB-D 或 RGB 信息。在九个 RGB-D SOD 基准数据集上的综合实验表明,与近期最先进方法相比,SiaTrans 具有最佳的整体性能和最少的计算量。

关键词

引用

@article{arxiv.2207.04224,
  title  = {SiaTrans: Siamese Transformer Network for RGB-D Salient Object Detection with Depth Image Classification},
  author = {Xingzhao Jia and Dongye Changlei and Yanjun Peng},
  journal= {arXiv preprint arXiv:2207.04224},
  year   = {2022}
}

备注

21 pages, 7 figures