中文

用于显著性检测的金字塔注意力

计算机视觉与模式识别 2022-04-15 v1

摘要

显著性目标检测(SOD)从输入图像中提取有意义的内容。基于RGB的SOD方法缺乏互补的深度线索,因此在复杂场景下性能有限。类似地,RGB-D模型处理RGB与深度输入,但测试阶段深度数据的可用性可能阻碍模型的实际应用。本文仅利用RGB图像,从RGB估计深度,并借助中间深度特征。我们采用金字塔注意力结构提取多级卷积-Transformer特征,以处理初始阶段表征并进一步增强后续表征。在每个阶段,主干Transformer模型产生全局感受野并并行计算,以获得由我们的残差卷积注意力解码器精化的细粒度全局预测,从而实现最优显著性预测。我们在八个RGB与RGB-D数据集上分别相较21和40种最先进SOD方法报告了显著改进的性能。据此,我们提出了一种无需在训练与测试中获取深度数据即可生成RGB-D SOD的新视角,并利用深度线索辅助RGB方法提升性能。代码与训练模型见 https://github.com/tanveer-hussain/EfficientSOD2

关键词

引用

@article{arxiv.2204.06788,
  title  = {Pyramidal Attention for Saliency Detection},
  author = {Tanveer Hussain and Abbas Anwar and Saeed Anwar and Lars Petersson and Sung Wook Baik},
  journal= {arXiv preprint arXiv:2204.06788},
  year   = {2022}
}

备注

Accepted at CVPRW 2022. (2022 IEEE CVPR Workshop on Fair, Data Efficient and Trusted Computer Vision)