中文

因果桥接:变换器语言模型中句法岛的梯度阻塞特征化

计算与语言 2026-04-16 v1

摘要

我们展示了如何通过在变换器模型中进行因果干预来获得关于英语语法的见解,聚焦于一个长期存在的语法理论挑战:句法岛。从协调动词短语中提取常常受到降解,但可接受性会随词汇内容而梯度变化(例如,“I know what he hates art and loves" 与 "I know what he looked down and saw")。我们展示了现代变换器语言模型在这一梯度上的人类判断。通过对变换器块、注意力模块和 MLP 中的功能相关子空间进行因果干预,我们证明从协调岛中提取涉及与标准 wh-依赖关系相同的填空-空槽机制,但这些机制的阻塞程度有所不同。通过将大量无关文本投影到这些因果识别的子空间上,我们推导出一种新的语言学假设:连词 "and" 在可提取与不可提取建构中被表示不同,对应于编码关系依赖与纯粹联合使用的表达。这些结果说明了机制可解释性如何能够 informs 语法,生成关于语言表示和处理的新假设。

关键词

引用

@article{arxiv.2604.13950,
  title  = {Causal Drawbridges: Characterizing Gradient Blocking of Syntactic Islands in Transformer LMs},
  author = {Sasha Boguraev and Kyle Mahowald},
  journal= {arXiv preprint arXiv:2604.13950},
  year   = {2026}
}

备注

19 pages, 7 figures, 3 tables