LookHere:具有定向注意力的视觉变换器实现泛化与外推
计算机视觉与模式识别
2024-10-31 v2
摘要
高分辨率图像提供更多场景信息,可提高模型精度。然而,计算机视觉中的主流模型架构——视觉变换器(ViT)无法有效利用更大图像而无需微调——ViT在测试时对更多补丁的外推能力差,尽管变换器具有序列长度灵活性。我们将此缺陷归因于当前的补丁位置编码方法,这些方法在外推时会产生分布偏移。我们提出了一种直接替换普通ViT位置编码的方法,该方法使用2D注意力掩码将注意力头限制在固定的视野范围内,指向不同方向。我们的新方法称为LookHere,提供平移等变性,确保注意力头多样性,并限制注意力头在外推时面临的分布偏移。我们证明LookHere在ImageNet上(无外推)提高了分类性能(平均1.6%)、对抗攻击鲁棒性(平均5.4%),并降低了校准误差(平均1.5%)。在外推情况下,当在224^2像素训练并在1024^2像素测试时,LookHere在ImageNet上比当前最先进的位置编码方法2D-RoPE高出21.7%。此外,我们发布了一个高分辨率测试集ImageNet-HR,以改进高分辨率图像分类器的评估。
引用
@article{arxiv.2405.13985,
title = {LookHere: Vision Transformers with Directed Attention Generalize and Extrapolate},
author = {Anthony Fuller and Daniel G. Kyrollos and Yousef Yassin and James R. Green},
journal= {arXiv preprint arXiv:2405.13985},
year = {2024}
}
备注
NeurIPS 2024 Camera Ready