Gramian 注意力头是强大而高效的视觉学习器
计算机视觉与模式识别
2023-10-26 v1
摘要
我们引入了一种新颖的架构设计,通过引入多个头分类器(即分类头)而非依赖通道扩展或额外构建模块来增强表达能力。我们的方法采用基于注意力的聚合,利用成对特征相似性以最小资源开销增强多个轻量头。我们计算 Gramian 矩阵以在注意力层中强化每个头的类令牌。这使各头能够学习更具判别性的表示,增强其聚合能力。此外,我们提出了一种学习算法,通过降低聚合相关性来鼓励头之间互补。我们的模型最终在 ImageNet-1K 的准确率-吞吐量权衡上超越了最先进的 CNN 和 ViT,并在各种下游任务(如 COCO 目标实例分割、ADE20k 语义分割和细粒度视觉分类数据集)上取得卓越性能。我们框架的有效性由实际实验结果证实,并进一步由泛化误差界支撑。我们在 https://github.com/Lab-LVM/imagenet-models 公开发布代码。
引用
@article{arxiv.2310.16483,
title = {Gramian Attention Heads are Strong yet Efficient Vision Learners},
author = {Jongbin Ryu and Dongyoon Han and Jongwoo Lim},
journal= {arXiv preprint arXiv:2310.16483},
year = {2023}
}