中文

Gramian 注意力头是强大而高效的视觉学习器

计算机视觉与模式识别 2023-10-26 v1

摘要

我们引入了一种新颖的架构设计,通过引入多个头分类器(即分类头)而非依赖通道扩展或额外构建模块来增强表达能力。我们的方法采用基于注意力的聚合,利用成对特征相似性以最小资源开销增强多个轻量头。我们计算 Gramian 矩阵以在注意力层中强化每个头的类令牌。这使各头能够学习更具判别性的表示,增强其聚合能力。此外,我们提出了一种学习算法,通过降低聚合相关性来鼓励头之间互补。我们的模型最终在 ImageNet-1K 的准确率-吞吐量权衡上超越了最先进的 CNN 和 ViT,并在各种下游任务(如 COCO 目标实例分割、ADE20k 语义分割和细粒度视觉分类数据集)上取得卓越性能。我们框架的有效性由实际实验结果证实,并进一步由泛化误差界支撑。我们在 https://github.com/Lab-LVM/imagenet-models 公开发布代码。

关键词

引用

@article{arxiv.2310.16483,
  title  = {Gramian Attention Heads are Strong yet Efficient Vision Learners},
  author = {Jongbin Ryu and Dongyoon Han and Jongwoo Lim},
  journal= {arXiv preprint arXiv:2310.16483},
  year   = {2023}
}