中文

DRTAM:双秩一张量注意力模块

计算机视觉与模式识别 2023-09-08 v2

摘要

近年来,注意力机制在计算机视觉中得到了广泛研究,但很少有方法在大型与移动端网络上均表现出优异性能。本文提出双秩一张量注意力模块(DRTAM),一种用于前馈卷积神经网络的、由残差注意力学习引导的新型注意力模块。给定3D特征张量图,DRTAM首先沿三个轴生成三个2D特征描述子。随后,DRTAM利用三个描述子依次推断两个秩一张量注意力图——初始注意力图与互补注意力图,将它们组合并乘到输入特征图以实现自适应特征精炼(见附图1(c))。为生成两个注意力图,DRTAM引入了秩一张量注意力模块(RTAM)与残差描述子提取模块(RDEM):RTAM将每个2D特征描述子分块,并对每块采用条带池化生成秩一张量注意力图的三个因子向量,从而沿三个维度分别捕获局部与长程上下文信息;RDEM利用初始注意力图的三个因子向量与输入特征的三个描述子,生成残差特征的三个2D描述子以产生互补注意力图。在ImageNet-1K、MS COCO和PASCAL VOC上的大量实验结果表明,与其他最先进注意力模块相比,DRTAM在大型与移动端网络上均取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2203.05893,
  title  = {DRTAM: Dual Rank-1 Tensor Attention Module},
  author = {Hanxing Chi and Baihong Lin and Jun Hu and Liang Wang},
  journal= {arXiv preprint arXiv:2203.05893},
  year   = {2023}
}

备注

There exists some problems on the experiments. Besides, we find that the sturcture of DRTAM can be optimized