中文

以均匀注意力轻抚视觉Transformer的后背

计算机视觉与模式识别 2024-12-30 v2 人工智能 机器学习

摘要

视觉Transformer(ViT)的优异性能常归功于多头自注意力(MSA)。MSA使ViT模型在每一层实现全局交互,这与卷积神经网络(CNN)跨多层逐步扩大交互范围形成对比。我们研究了注意力密度的角色。初步分析表明,注意力图的空间交互接近于稠密交互而非稀疏交互。这是一个有趣现象,因为稠密注意力图因周围更陡的softmax梯度而更难学习。我们将其解读为ViT模型强烈偏好包含稠密交互。因此我们手动将均匀注意力插入ViT各层以补充迫切需要的稠密交互。称此方法为上下文广播(CB)。我们观察到引入CB降低了原始注意力图的密度程度,并提升了ViT模型的容量与泛化性。CB成本可忽略:模型代码中1行、无额外参数、极少额外运算。

关键词

引用

@article{arxiv.2210.08457,
  title  = {Scratching Visual Transformer's Back with Uniform Attention},
  author = {Nam Hyeon-Woo and Kim Yu-Ji and Byeongho Heo and Dongyoon Han and Seong Joon Oh and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2210.08457},
  year   = {2024}
}