中文

用 Transformer 统一显著目标检测中的全局-局部表示

计算机视觉与模式识别 2024-03-19 v2

摘要

全卷积网络(FCN)在显著目标检测中长期占据主导地位。然而,CNN 的局部性要求模型足够深以拥有全局感受野,而如此深的模型总会导致局部细节的丢失。本文中,我们将一种新的基于注意力的编码器——视觉 Transformer——引入显著目标检测,以确保从浅层到深层表示的全局化。借助极浅层中的全局视野,Transformer 编码器保留了更多局部表示以在最终显著图中恢复空间细节。此外,由于每一层都能捕获其前一层的一个全局视野,相邻层可隐式最大化表示差异并最小化冗余特征,使得 Transformer 各层的每个输出特征都对最终预测有独特贡献。为解码来自 Transformer 的特征,我们提出了一种简单而有效的深度变换解码器。该解码器密集解码并上采样 Transformer 特征,以更少的噪声注入生成最终显著图。实验结果表明,我们的方法在五个基准上以较大优势显著优于其他基于 FCN 和基于 Transformer 的方法,在平均绝对误差(MAE)方面平均提升 12.17%。代码将发布于 https://github.com/OliverRensu/GLSTR。

关键词

引用

@article{arxiv.2108.02759,
  title  = {Unifying Global-Local Representations in Salient Object Detection with Transformer},
  author = {Sucheng Ren and Qiang Wen and Nanxuan Zhao and Guoqiang Han and Shengfeng He},
  journal= {arXiv preprint arXiv:2108.02759},
  year   = {2024}
}

备注

accepted by IEEE TETCI