用于解释视觉转换器决策演化的动态累积注意力图
计算机视觉与模式识别
2025-03-20 v1 人工智能
摘要
各种视觉转换器 (ViT) 模型在图像识别任务中广泛应用。然而,现有的视觉解释方法无法显示 ViT 模型内部隐藏的注意力流,这些方法解释了最终注意力区域是如何在 ViT 中形成以做出决策。本文提出了一种新颖的视觉解释方法——动态累积注意力图 (DAAM),用于首次显示通过 ViT 网络的注意力流。为此,我们提出了一种新型分解模块,通过解锁每个 ViT 块的自注意力模块生成的 [class] token 来构建和存储空间特征信息。该模块还可以通过分解监督 ViT 模型的分类得分来获取通道重要性系数。由于自监督 ViT 模型缺乏分类得分,我们提出了按维度计算通道重要性系数的注意力权重。这些空间特征与相应的通道重要性系数线性组合,形成每个块的注意力图。通过按块累积每个注意力图,揭示了动态注意力流。本文的贡献在于通过提出新型分解模块和维度注意力权重,为解释 ViT 模型中任何中间块的决策注意力演化提供了可视化工具。定量和定性分析一致地验证了所提出 DAAM 在不仅仅是用全连接层作为分类器的 ViT 模型,也在自监督 ViT 模型方面的有效性和优越性能。代码可在 https://github.com/ly9802/DynamicAccumulatedAttentionMap 获取。
引用
@article{arxiv.2503.14640,
title = {Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer},
author = {Yi Liao and Yongsheng Gao and Weichuan Zhang},
journal= {arXiv preprint arXiv:2503.14640},
year = {2025}
}