中文

因果头门控:一种解释Transformer注意力头作用的框架

人工智能 2025-10-27 v2

摘要

我们提出了因果头门控(CHG),这是一种可解释Transformer模型中注意力头功能作用的可扩展方法。CHG对注意力头学习软门并根据其对任务性能的影响将其分配给因果分类——促进、干扰或无关。不同于先前在机制可解释性方法,后者是假设驱动的,需要prompt模板或目标标签,CHG可直接应用于任何数据集使用标准的下一个标记预测。我们在Llama 3模型系列中的多个大型语言模型(LLMs)和多样化任务上评估了CHG,包括语法、常识和数学推理,并表明CHG分数yield因果性的、不仅仅是相关性的见解,通过ablation和因果中介分析进行验证。我们还引入了对比CHG,这是一种隔离特定任务组件子电路的变体。我们的发现表明,LLMs包含多个稀疏任务充分子电路,单个头的角色取决于与其他头的相互作用(模块性低),并且指令遵循和情境学习依赖于可分离的机制。

关键词

引用

@article{arxiv.2505.13737,
  title  = {Causal Head Gating: A Framework for Interpreting Roles of Attention Heads in Transformers},
  author = {Andrew Nam and Henry Conklin and Yukang Yang and Thomas Griffiths and Jonathan Cohen and Sarah-Jane Leslie},
  journal= {arXiv preprint arXiv:2505.13737},
  year   = {2025}
}

备注

10 pages, 5 figures, 2 tables. The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)