中文

偶数头部纠正奇数错误:变换器注意力中的机械发现与手术修复

机器学习 2025-08-28 v1 人工智能

摘要

我们提出了对 Llama-3.1-8B-Instruct 模型中一种格式依赖推理故障的机械案例研究。该故障表现为:在聊天或问答格式中,模型错误地判断 "9.11" 大于 "9.8",但在简单格式下却答对了。通过系统性干预,我们发现变换器实现了偶/奇注意力头专化:偶数索引的注意力头负责数值比较,而奇数注意力头则执行不兼容的功能。该错误恰好需要在第 10 层拥有 8 个偶数注意力头才能完美修复。任何包含 8 个以上偶数注意力头的组合都能成功,而 7 个或以下则完全失败,揭示了计算阈值的精确冗余性——这 16 个偶数注意力头之间存在完美的冗余性。SAE 分析揭示了该机制:格式表示在第 7 层分离(仅 10% 特征重叠),随后在第 10 层重新耦合(80% 特征重叠),其中特定特征在失效格式中放大 1.5 倍。我们仅使用 25% 的注意力头即可实现完美修复,并识别出 60% 的模式替换阈值,表明表面上对完整模块的要求掩盖了具有复杂子结构的事实,这对可解释性和效率都有深远影响。我们的所有代码均已公开于 https://github.com/gussand/surgeon。

关键词

引用

@article{arxiv.2508.19414,
  title  = {Even Heads Fix Odd Errors: Mechanistic Discovery and Surgical Repair in Transformer Attention},
  author = {Gustavo Sandoval},
  journal= {arXiv preprint arXiv:2508.19414},
  year   = {2025}
}

备注

9 pages