中文

ExPLAIND:统一解释模型、数据与训练归因以研究模型行为

机器学习 2025-10-02 v3

摘要

后验可解释性方法通常以孤立方式归因于模型的各个组成部分、数据或训练轨迹,这导致解释缺乏统一视图,可能遗漏关键交互作用。虽然组合现有方法或在不同训练阶段应用它们能提供更广泛的见解,但此类方法通常缺乏理论支持。本文提出 ExPLAIND,一个统一框架,整合所有这些视角。首先,我们推广最近关于梯度路径核的工作,将通过梯度下降训练的模型重新表述为核机器,扩展至如 AdamW 等更现实的情景。我们经验性地验证了卷积神经网络和 Transformer 都能被这种重新表述准确复制。其次,我们从核特征图中推导出新的参数级和步级影响分数。它们在参数修剪方面的效果相当于现有方法,证明了其在模型组件归因方面的价值。最后,在联合解释模型组件和数据随训练过程的过程中,我们利用 ExPLAIND 分析一个出现 Grokking 现象的 Transformer。我们的发现支持此前提出的 Grokking 阶段,同时细化了最终阶段:在记忆阶段之后学习的表示管道后,输入嵌入与最终层围绕某种表示进行对齐。总体而言,ExPLAIND 提供了一个在解释模型行为和训练动力学方面具有理论依据的统一框架。

关键词

引用

@article{arxiv.2505.20076,
  title  = {ExPLAIND: Unifying Model, Data, and Training Attribution to Study Model Behavior},
  author = {Florian Eichin and Yupei Du and Philipp Mondorf and Maria Matveev and Barbara Plank and Michael A. Hedderich},
  journal= {arXiv preprint arXiv:2505.20076},
  year   = {2025}
}

备注

10 pages main paper, 25 pages in total, code at https://github.com/mainlp/explaind