中文

面向计算机视觉的双正交因子分解

计算机视觉与模式识别 2026-01-12 v1 人工智能

摘要

自注意力机制是视觉 Transformer 的核心计算原语, 然而我们对注意力机制在标记之间交换什么信息缺乏原则性的理解. 注意力图描述了权重质量的集中位置; 它们不揭示查询 (query) 和键 (key) 是否在位置、内容或两者之间进行交换. 我们引入双正交因子分解 (Bi-orthogonal Factor Decomposition, BFD), 这是一个两阶段的分析框架: 首先, 通过方差分析 (ANOVA) 基于统计方法将标记激活分解为正交的位置因子和内容因子; 其次, 对查询-键相互作用矩阵 QK^T 进行奇异值分解 (SVD), 以揭示这些因子如何调解通信. 在验证位置和内容被正确分离后, 我们将 BFD 应用于最先进的视觉模型, 并发现三种现象.(i) 注意力主要通过内容运作. 内容-内容相互作用占据注意力能量, 其次是内容-位置的耦合. DINOv2 在内容-位置分配能量方面超过监督模型, 并在更丰富的模谱上分布计算.(ii) 注意力机制表现出专业化: 头部不同iates into 内容-内容、内容-位置和位置-位置运算符, 而单个头部内部的奇异模也表现出类似的专业化.(iii) DINOv2 在整体形状处理方面的优越性, 源于中间层同时保持位置结构, 同时在语义内容方面进行上下文丰富化. 总体而言, BFD 揭示了标记如何通过注意力相互作用, 以及哪些信息因子 - 位置因子或语义因子 - 调节它们的通信, 从而为理解视觉 Transformer 机制提供了实用见解.

关键词

引用

@article{arxiv.2601.05328,
  title  = {Bi-Orthogonal Factor Decomposition for Vision Transformers},
  author = {Fenil R. Doshi and Thomas Fel and Talia Konkle and George Alvarez},
  journal= {arXiv preprint arXiv:2601.05328},
  year   = {2026}
}