剖析视觉 Transformer 中的 Query-Key 交互
计算机视觉与模式识别
2025-01-15 v4 人工智能
摘要
视觉 Transformer 中的自注意力机制常被认为执行感知分组,即 token 对具有相似嵌入的其他 token 进行注意,可能对应于物体的语义相似特征。然而,对不相似的 token 进行注意可能通过提供上下文信息来发挥积极作用。我们提出通过对交互矩阵(即 )的奇异值分解来分析 query-key 交互。我们发现,在许多 ViT 中,尤其是具有分类训练目标的 ViT,早期层对相似 token 的注意更强,而晚期层注意力转向不相似的 token,这分别提供了感知分组和上下文化的证据。许多这些由奇异向量表示的特征之间的交互是可解释且具有语义的,例如注意力在相关物体之间、物体部件之间,或前景与背景之间。这为解释注意力机制提供了一种新视角,助力理解 Transformer 模型在处理图像时如何利用上下文和显著特征。
引用
@article{arxiv.2405.14880,
title = {Dissecting Query-Key Interaction in Vision Transformers},
author = {Xu Pan and Aaron Philip and Ziqian Xie and Odelia Schwartz},
journal= {arXiv preprint arXiv:2405.14880},
year = {2025}
}