增强视觉Transformer中令牌注意力的鲁棒性
计算机视觉与模式识别
2023-09-07 v3
摘要
尽管视觉Transformer(ViTs)取得了成功,它们在存在常见 corruptions(如噪声或模糊)时仍会出现准确率的显著下降。有趣的是,我们观察到ViTs的注意力机制倾向于依赖少数重要令牌,我们将这一现象称为令牌过度聚焦(token overfocusing)。更关键的是,这些令牌对 corruptions 并不鲁棒,常导致高度发散的注意力模式。在本文中,我们旨在通过两种通用技术缓解这一过度聚焦问题并使注意力更加稳定:首先,我们的令牌感知平均池化(Token-aware Average Pooling, TAP)模块鼓励每个令牌的局部邻域参与注意力机制。具体而言,TAP为每个令牌学习平均池化方案,从而可自适应地考虑邻域中潜在重要令牌的信息。其次,我们利用注意力多样化损失(Attention Diversification Loss, ADL)迫使输出令牌聚合来自多样化输入令牌集合的信息,而非仅聚焦于少数令牌。我们通过惩罚不同令牌注意力向量间的高余弦相似度来实现这一点。在实验中,我们将方法应用于广泛的Transformer架构并显著提升了鲁棒性。例如,基于最先进的鲁棒架构FAN,我们在ImageNet-C上将 corruption 鲁棒性提升2.4%,同时准确率提升0.4%。此外,在语义分割任务上微调时,我们在CityScapes-C上提升鲁棒性2.4%,在ACDC上提升3.0%。我们的代码见 https://github.com/guoyongcs/TAPADL。
引用
@article{arxiv.2303.11126,
title = {Robustifying Token Attention for Vision Transformers},
author = {Yong Guo and David Stutz and Bernt Schiele},
journal= {arXiv preprint arXiv:2303.11126},
year = {2023}
}
备注
To appear in ICCV 2023