条件共消融:恢复Transformer电路中的自我修复备份
机器学习
2026-07-02 v1 人工智能
摘要
机械可解释性通常依赖于组件级干预来发现模型如何产生行为。这指导了归因、能力消除和模型剪枝,通过根据隔离消融的效果对每个单元进行评分来操作。当组件重要性是可加性的时,这种一阶评分是自然的,但当Transformer自我修复时就会变得误导:在主要组件被移除后,一个休眠的备份可以接管,抑制主要组件的测量效果,而备份本身在完整模型上看起来无关紧要。我们将这种失败重新定义为恢复任务,即条件电路补全,并引入条件共消融(CoAx),一种无标签、输出接地分数,询问一旦主要集合被移除,每个剩余单元的消融效果增长多少。这种条件增长揭示了一阶评分丢弃的二阶交互。在GPT-2-small IOI电路上,CoAx将备份头恢复从0.33提高到0.91 ROC-AUC,优于所有基线,包括自我修复感知梯度分数(最佳0.82);反事实修补验证了恢复的头因果地携带修复。相同的无标签程序转移到八个模型上的归纳。除了发现之外,恢复的备份纠正了自我修复掩盖的归因,识别了能力消除所需的组件,并产生了从124M到7B的修复感知结构化剪枝。因此,组件重要性不仅仅是孤立单元属性:在鲁棒电路中,重要的组件可能只有在使它们变得必要的干预下才可见。
引用
@article{arxiv.2607.01940,
title = {Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits},
author = {Zhiren Gong and Zihao Zeng and Chau Yuen and Wei Yang Bryan Lim},
journal= {arXiv preprint arXiv:2607.01940},
year = {2026}
}