中文

基于词义歧义的注意力专化发展探针

计算与语言 2025-12-01 v1

摘要

尽管对自注意力矩阵操作在 Transformer 语言模型(LMs)中的原则理解,但仍不清楚这些操作如何映射到可解释的计算或函数,以及个体注意力头如何发展出特殊化的注意力模式。本文提出了一套系统性探针注意力机制的方法,并通过利用词义歧义——单个单词具有多个意义——来隔离贡献词义消歧的注意力机制。我们采用“发展”方法:首先,使用公开可用的 Pythia LM 检查点,我们识别每个 LM 在消歧性能中的拐点;在 14M 和 410M 模型中,我们识别出注意力头的注意力对消歧词的注意力随整体消歧性能的变化。我们随后对这些头进行压力测试其对刺激扰动的鲁棒性:在 14M 中,我们发现鲁棒性有限,但在 410M 中,我们识别出多个具有惊人普遍性行为的注意力头。随后,在因果分析中,我们发现剔除目标注意力头会显著损害消歧性能,尤其在 14M 中。我们此外在 14M 的所有随机种子上复现了发展分析。总体而言,这些结果表明:消歧受多种机制共同作用的帮助,一些机制(尤其在 14M 中)对消歧线索的位置和词性高度敏感;更大模型(410M)可能包含具有更鲁棒消歧行为的注意力头。它们还加入了一个不断增长的工作集合,突出了在探针 LM 机制时采用发展视角的价值。

关键词

引用

@article{arxiv.2511.21974,
  title  = {Start Making Sense(s): A Developmental Probe of Attention Specialization Using Lexical Ambiguity},
  author = {Pamela D. Rivière and Sean Trott},
  journal= {arXiv preprint arXiv:2511.21974},
  year   = {2025}
}

备注

13 pages (main text), 5 figures (main text) 6 pages (appendix), 6 figures (appendix), journal submission to TACL ("a" decision: pre-MIT Press publication version)