GIM:改进大型语言模型的可解释性
计算与语言
2025-10-02 v3 机器学习
摘要
确保大型语言模型中的忠实可解释性对于可信和可靠的AI至关重要。一个关键障碍是自修复,即网络通过放大其他组件来补偿某个组件中信号的减弱,从而掩盖被消融组件的真实重要性。虽然先前工作将自修复归因于层归一化和补偿被消融组件的备份组件,但我们识别出一种发生在注意力机制内部的新形式,其中softmax重分布掩盖了重要注意力分数的影响。这导致传统的消融和基于梯度的方法低估了所有贡献于这些注意力分数的组件的重要性。我们引入了梯度交互修正(GIM),一种在反向传播中考虑自修复的技术。在多个大型语言模型(Gemma 2B/9B、LLAMA 1B/3B/8B、Qwen 1.5B/3B)和多样化任务上的广泛实验表明,GIM显著提高了忠实性,优于现有的电路识别和特征归因方法。我们的工作是在更好地理解LLM内部机制方面的重要一步,这对改进LLM和确保其安全性至关重要。我们的代码可在https://github.com/JoakimEdin/gim获取。
引用
@article{arxiv.2505.17630,
title = {GIM: Improved Interpretability for Large Language Models},
author = {Joakim Edin and Róbert Csordás and Tuukka Ruotsalo and Zhengxuan Wu and Maria Maistro and Casper L. Christensen and Jing Huang and Lars Maaløe},
journal= {arXiv preprint arXiv:2505.17630},
year = {2025}
}