基于 Transformer 的 RGB-D 显著性检测网络
计算机视觉与模式识别
2021-12-02 v1
摘要
RGB-D 显著性检测整合来自 RGB 图像与深度图的信息,以在挑战性条件下改进显著区域的预测。RGB-D 显著性检测的关键在于充分挖掘并融合两种模态下多尺度的信息。先前的方法倾向于通过局部操作分别进行多尺度与多模态融合,难以捕捉长程依赖。本文提出一种基于 transformer 的网络来解决该问题。我们提出的架构由两个模块组成:基于 transformer 的模态内特征增强模块(TWFEM)与基于 transformer 的特征融合模块(TFFM)。TFFM 通过同时在所有位置上整合多尺度与双模态特征,实现充分的特征融合。TWFEM 在 TFFM 之前,通过从同模态其他尺度中选择并整合互补信息来增强各尺度特征。我们表明 transformer 是一种统一操作,在特征融合与特征增强中均展现出极佳效能,并简化了模型设计。在六个基准数据集上的大量实验结果表明,我们提出的网络优于最先进的 RGB-D 显著性检测方法。
引用
@article{arxiv.2112.00582,
title = {Transformer-based Network for RGB-D Saliency Detection},
author = {Yue Wang and Xu Jia and Lu Zhang and Yuke Li and James Elder and Huchuan Lu},
journal= {arXiv preprint arXiv:2112.00582},
year = {2021}
}