通过混合归因和修剪框架发现Transformer电路
机器学习
2025-10-07 v1 计算与语言
摘要
解释语言模型通常涉及电路分析,即旨在识别完成特定任务的稀疏子网络或电路。现有的电路发现算法面临基本权衡:归因修补速度快但不忠实于完整模型,而边缘修剪忠实但计算成本高昂。本研究提出了混合归因和修剪(HAP)框架,利用归因修补识别高潜力子图,然后应用边缘修剪从中提取忠实电路。我们展示HAP比基线算法快46%,而不牺牲电路忠实性。此外,我们在间接对象识别任务上进行案例研究,表明该方法保留了归因修补方法在高稀疏度下修剪的合作电路组件(例如S抑制头)。我们的结果表明,HAP可以是提高机理可解释性研究规模化的有效方法。我们的代码可在https://anonymous.4open.science/r/HAP-circuit-discovery获得。
关键词
引用
@article{arxiv.2510.03282,
title = {Discovering Transformer Circuits via a Hybrid Attribution and Pruning Framework},
author = {Hao Gu and Vibhas Nair and Amrithaa Ashok Kumar and Jayvart Sharma and Ryan Lagasse},
journal= {arXiv preprint arXiv:2510.03282},
year = {2025}
}
备注
Accepted to the NeurIPS 2025 Workshop on Mechanistic Interpretability (Mechinterp) and the NeurIPS 2025 Workshop on New Perspectives in Graph Machine Learning