GMAR:面向视觉 Transformer 可解释性的梯度驱动的多头注意力扩散
计算机视觉与模式识别
2025-04-29 v1
摘要
视觉 Transformer (ViT) 已在计算机视觉领域取得显著进展,利用自注意力机制在图像分类、目标检测和分割等多个任务上实现了最先进的性能。其 architectural flexibility 和强大能力使其成为研究人员和实践者的首选。然而,ViT 复杂的多头注意力机制给可解释性带来了重大挑战,因为底层的预测过程仍然是不透明的。一个关键限制源于 transformer 架构中常见的观察:“并非所有注意力头都同等有意义”。忽略特定注意力头的相对重要性凸显了现有可解释性方法的局限性。为解决这些挑战,我们提出了梯度驱动的多头注意力扩散方法 (Gradient-Driven Multi-Head Attention Rollout, GMAR),该方法利用基于梯度的评分对每个注意力头的重要性进行量化。通过归一化这些评分,可派生出加权聚合注意力评分,有效捕捉各个注意力头的相对贡献。GMAR 清晰地揭示了每个注意力头在预测过程中的作用,使 head 级别的可解释性更加精确。实验结果表明,GMAR 在可靠性上一致优于传统注意力扩散技术。这一工作为基于 transformer 的架构提供了实用贡献,建立了强大的框架以增强视觉 Transformer 模型的可解释性。
关键词
引用
@article{arxiv.2504.19414,
title = {GMAR: Gradient-Driven Multi-Head Attention Rollout for Vision Transformer Interpretability},
author = {Sehyeong Jo and Gangjae Jang and Haesol Park},
journal= {arXiv preprint arXiv:2504.19414},
year = {2025}
}