中文

视觉 Transformer 中的注意力如何运作?一种可视化分析尝试

机器学习 2023-03-27 v1 计算机视觉与模式识别 人机交互

摘要

视觉 Transformer(ViT)将 Transformer 模型在序列数据上的成功拓展到了图像领域。该模型将图像分解为许多更小的图像块并排列成序列。随后对序列施加多头自注意力以学习图像块之间的注意力。尽管针对序列数据的 Transformer 已有诸多成功解释,但对 ViT 的解释工作甚少,许多问题仍待解答。例如,众多注意力头中哪一个更为重要?在不同头中,单个图像块对其空间邻域的注意力有多强?各个头学到了何种注意力模式?本工作中,我们通过可视化分析方法回答这些问题。具体而言,我们首先通过引入多种基于剪枝的度量来识别 ViT 中哪些头更为重要。接着,我们刻画单个头内部图像块间注意力强度的空间分布,以及注意力强度跨注意力层的趋势。第三,利用基于自编码器的学习方案,我们总结了各个头可能学到的所有注意力模式。考察重要头的注意力强度与模式,我们回答了它们为何重要。通过与资深深度学习专家在多个 ViT 上的具体案例研究,我们验证了该方案的有效性,其从头重要性、头注意力强度及头注意力模式三方面深化了对 ViT 的理解。

关键词

引用

@article{arxiv.2303.13731,
  title  = {How Does Attention Work in Vision Transformers? A Visual Analytics Attempt},
  author = {Yiran Li and Junpeng Wang and Xin Dai and Liang Wang and Chin-Chia Michael Yeh and Yan Zheng and Wei Zhang and Kwan-Liu Ma},
  journal= {arXiv preprint arXiv:2303.13731},
  year   = {2023}
}

备注

Accepted by PacificVis 2023 and selected to be published in TVCG