电路能告诉我们多少?衡量语言模型电路的一致性和特异性
计算与语言
2026-05-12 v1
摘要
可解释性机制中的电路框架旨在识别模型组件中因果重要的稀疏子图,通常通过测量必要性和充分性来评估。我们测量了电路复用,即任务内每个示例电路之间共享组件的比例,并研究了其两个较少被研究的属性:一致性,即组件在任务内的重复出现;以及特异性,即它们对任务的独特性。使用跨六个任务和七个模型的边归因修补,我们发现任务内复用率很高,并且共享组件对于任务性能是必要的,消融导致相对准确率下降高达100%。然而,电路结果并非任务特异性的:消融一个任务的电路对另一个任务性能的损害程度与该任务自身电路造成的损害大致相同。我们发现这是由于不同任务之间的电路存在大量重叠,这些重叠对性能具有因果重要性。一些电路确实包含一组较小的任务特异性组件,但这些仅占电路性能的一小部分。总的来说,我们的发现表明,虽然在注意力头和MLP层级别上的电路发现识别出了重要组件,但它们缺乏任务特异性,这引发了关于电路能在多大程度上支持对模型行为进行有针对性的理解和干预的问题。
引用
@article{arxiv.2605.08348,
title = {How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits},
author = {Michael Li and Nishant Subramani},
journal= {arXiv preprint arXiv:2605.08348},
year = {2026}
}