中文

自注意力向量输出相似性揭示机器的注意力机制

计算与语言 2026-02-04 v2

摘要

自注意力机制显著推动了自然语言处理领域的发展,促进了先进语言学习机器的研发。尽管其效用已得到广泛认可,但自注意力支撑其高级学习的精确机制以及对这一学习过程的定量表征仍是一个开放的研究问题。本研究引入了一种量化自注意力机制内信息处理的新方法。在 BERT-12 架构上进行的分析表明,在最后一层中,注意力图聚焦于句子分隔符 token,这提出了一种基于语义特征的文本分割实用方法。基于自注意力头产生的向量空间,推导出了一个上下文相似度矩阵,用于测量两个 token 向量之间的标量积,揭示了每个头和层内不同 token 向量对之间截然不同的相似性。研究结果表明,一个注意力块内的不同注意力头聚焦于不同的语言学特征,例如识别给定文本中的 token 重复,或识别文本中常见出现的 token 及其周围上下文。随着架构的推进,这种专门化也反映在高相似性 token 向量之间的距离分布中。初始注意力层表现出显著的远距离相似性;然而,随着层的推进,发展出一种更近距离的相似性,最终表现为注意力头倾向于在同一句子内创建强相似性。最后,通过考察各个头在高相似性元素中最常见 token 的唯一性,分析了单个头的行为。每个头倾向于聚焦于文本中一个独特的 token,并围绕它构建相似性对。

关键词

引用

@article{arxiv.2512.21956,
  title  = {Self-attention vector output similarities reveal how machines pay attention},
  author = {Tal Halevi and Yarden Tzach and Ronit D. Gross and Shalom Rosner and Ido Kanter},
  journal= {arXiv preprint arXiv:2512.21956},
  year   = {2026}
}

备注

23 pages, 14 figures