中文

语言模型中自修复现象的探索

机器学习 2025-04-15 v2 人工智能 计算与语言

摘要

先前研究窄分布的可解释性工作初步识别出自修复(self-repair)现象,即当大型语言模型中的组件被消融时,后续组件会改变其行为以进行补偿。我们的工作在此基础上,证明了当在完整训练分布上消融单个注意力头时,自修复现象存在于多种模型家族和规模中。我们进一步表明,在完整训练分布上,自修复是不完美的,因为头的原始直接效应并未完全恢复;同时也是有噪声的,因为自修复的程度在不同提示词间差异显著(有时会过度修正超出原始效应)。我们强调了促成自修复的两种不同机制,包括最终 LayerNorm 缩放因子的变化以及实现反擦除(Anti-Erasure)的稀疏神经元集。此外,我们讨论了这些结果对可解释性实践者的意义,并以更具推测性的讨论结束,探讨为何自修复根本会在这些模型中发生这一谜团,同时突出了支持语言模型中迭代推理(Iterative Inference)假设的证据,该框架预测了自修复现象。

关键词

引用

@article{arxiv.2402.15390,
  title  = {Explorations of Self-Repair in Language Models},
  author = {Cody Rushing and Neel Nanda},
  journal= {arXiv preprint arXiv:2402.15390},
  year   = {2025}
}

备注

ICML 2024