中文

RelP:通过相关性修补发现语言模型中的忠实且高效的电路

机器学习 2025-10-31 v2

摘要

激活修补是机械可解释性中用于局部化模型特定行为所负责组件的标准方法,但规模化应用时计算成本高昂。归因修补提供了一种基于梯度的快速近似方法,然而在深层高度非线性网络中易受噪声干扰且可靠性降低。本文引入了相关性修补(RelP),其将归因修补中的局部梯度替换为来自图层相关性传播(LRP)的传播系数。LRP 通过反向传播网络输出到各层,根据确保相关性守恒或改进信噪比等属性的局部传播规则,将相关性重新分配到较低层组件。类似于归因修补,RelP 只需两个前向传播和一次反向传播,保持计算效率的同时提高忠实性。我们在多种模型和任务上验证了 RelP,表明其比标准归因修补更准确地逼近激活修补,尤其在分析间接宾主识别(IOI)任务中对残差流和 MLP 输出时效果更佳。例如,在 GPT-2 Large 的 MLP 输出上,归因修补的皮尔逊相关系数为 0.006,而 RelP 达到 0.956,凸显了 RelP 提供的改进。此外,我们比较了 RelP 和集成梯度(IG)识别的稀疏特征电路的忠实性,表明 RelP 在不增加 IG 额外计算成本的情况下实现了可比的忠实性。

关键词

引用

@article{arxiv.2508.21258,
  title  = {RelP: Faithful and Efficient Circuit Discovery in Language Models via Relevance Patching},
  author = {Farnoush Rezaei Jafari and Oliver Eberle and Ashkan Khakzar and Neel Nanda},
  journal= {arXiv preprint arXiv:2508.21258},
  year   = {2025}
}