中文

剖析视觉 Transformer 中的 Query-Key 交互

计算机视觉与模式识别 2025-01-15 v4 人工智能

摘要

视觉 Transformer 中的自注意力机制常被认为执行感知分组,即 token 对具有相似嵌入的其他 token 进行注意,可能对应于物体的语义相似特征。然而,对不相似的 token 进行注意可能通过提供上下文信息来发挥积极作用。我们提出通过对交互矩阵(即 WqWk{\textbf{W}_q}^\top\textbf{W}_k)的奇异值分解来分析 query-key 交互。我们发现,在许多 ViT 中,尤其是具有分类训练目标的 ViT,早期层对相似 token 的注意更强,而晚期层注意力转向不相似的 token,这分别提供了感知分组和上下文化的证据。许多这些由奇异向量表示的特征之间的交互是可解释且具有语义的,例如注意力在相关物体之间、物体部件之间,或前景与背景之间。这为解释注意力机制提供了一种新视角,助力理解 Transformer 模型在处理图像时如何利用上下文和显著特征。

关键词

引用

@article{arxiv.2405.14880,
  title  = {Dissecting Query-Key Interaction in Vision Transformers},
  author = {Xu Pan and Aaron Philip and Ziqian Xie and Odelia Schwartz},
  journal= {arXiv preprint arXiv:2405.14880},
  year   = {2025}
}