隐藏英雄与梯度膨胀:层级冗余颠覆Transformer中的归因
机器学习
2026-05-12 v3 人工智能
计算与语言
摘要
梯度归因是机制可解释性的核心方法,但其在组件层面是否可靠地跟踪因果重要性仍 largely 未被测试。我们在两个算法任务上进行因果评估(最多10个随机种子),发现系统性的、层级的失效:梯度归因持续高估了早期层的\textbf{梯度膨胀},而低估了后期层的\textbf{隐藏英雄}。相关系数从序列反转的 下降到序列排序的 ,甚至在单个随机种子中达到 。这种失效源于一阶梯度归因无法检测集体冗余:联合Bloat消除导致损坏程度是个体结果预测的14倍。因此,尽管Bloats对实际功能影响微乎其微,仍主导梯度排名,而消除隐藏英雄则导致OOD准确率下降()。这种早期层特征提取与后期层计算在归因上的系统性颠覆促使我们将因果验证作为电路层声明的必要前提。
关键词
引用
@article{arxiv.2602.01442,
title = {Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers},
author = {Donald Ye},
journal= {arXiv preprint arXiv:2602.01442},
year = {2026}
}
备注
9 pages, 6 figures, under review at ICML 2026 Workshop on Mechanistic Interpretability