中文

通过多阶段跨尺度注意力增强视觉骨干网络

计算机视觉与模式识别 2023-08-16 v2

摘要

卷积神经网络(CNNs)与视觉Transformer(ViTs)在各种视觉任务中取得了显著成功。然而,许多架构未考虑来自不同阶段与尺度的特征图之间的交互,这可能限制其性能。在本工作中,我们提出一种简单的附加注意力模块,通过多阶段与跨尺度交互来克服这些局限。具体而言,所提多阶段跨尺度注意力(MSCSA)模块利用来自不同阶段的特徵图实现多阶段交互,并基于多阶段特征图在不同尺度上计算自注意力以实现跨尺度交互。我们在若干下游任务上的实验表明,MSCSA 以适度的额外 FLOPs 与运行时间带来了显著的性能提升。

关键词

引用

@article{arxiv.2308.05872,
  title  = {Vision Backbone Enhancement via Multi-Stage Cross-Scale Attention},
  author = {Liang Shang and Yanli Liu and Zhengyang Lou and Shuxue Quan and Nagesh Adluru and Bochen Guan and William A. Sethares},
  journal= {arXiv preprint arXiv:2308.05872},
  year   = {2023}
}