中文

基于Transformer的非对称双边U-Net增强显著目标检测

计算机视觉与模式识别 2023-08-22 v6

摘要

现有的显著目标检测(SOD)方法主要依赖带有跳跃连接的U形卷积神经网络(CNNs),以分别结合对定位显著目标至关重要的全局上下文与对细化目标细节至关重要的局部空间细节。尽管取得了巨大成功,CNNs在学习全局上下文方面的能力仍有限。近来,视觉transformer因其在全局依赖建模上的强大能力在计算机视觉中取得了革命性进展。然而,直接将transformer应用于SOD是次优的,因为transformer缺乏学习局部空间表征的能力。为此,本文探索将transformers与CNNs结合,以学习SOD的全局与局部表征。我们提出了一种基于transformer的非对称双边U-Net(ABiU-Net)。非对称双边编码器具有一条transformer路径与一条轻量CNN路径,两条路径在每个编码器阶段进行通信,分别学习互补的全局上下文与局部空间细节。非对称双边解码器同样由两条路径组成,用于处理来自transformer与CNN编码器路径的特征,并在每个解码器阶段进行通信,分别解码粗粒度显著目标位置与细粒度目标细节。两条编码器/解码器路径间的此类通信使AbiU-Net能够利用transformers与CNNs各自的天然优势,学习互补的全局与局部表征。因此,ABiU-Net为基于transformer的SOD提供了新视角。大量实验表明,ABiU-Net优于以往最先进的SOD方法。代码见 https://github.com/yuqiuyuqiu/ABiU-Net。

关键词

引用

@article{arxiv.2108.07851,
  title  = {Boosting Salient Object Detection with Transformer-based Asymmetric Bilateral U-Net},
  author = {Yu Qiu and Yun Liu and Le Zhang and Jing Xu},
  journal= {arXiv preprint arXiv:2108.07851},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)