寻找语言模型中可解释的提示特定电路
机器学习
2026-05-15 v2 人工智能
摘要
理解语言模型用于解决任务的内部电路仍是可解释性领域的核心挑战。寻找电路的一个关键环节是理解每个注意力头为何关注特定位置。为此,我们引入 ACC++,这是一种基于注意力因果通信(ACC)[1] 的改进电路追踪方法,识别导致注意力在 token 对之间产生的信号,即低维子空间的内容。ACC++ 在单次前向传播中提取电路,无需替换模型或修补。ACC++ 提取的电路由导致模型注意力决策的组件及其之间用于通信的低维信号构成。我们首先详述了 ACC++ 相对于前期工作的概念性进展。随后我们表明,在多个模型中,ACC++ 的大部分信号都是可解释的:许多信号可归约为简短的自然语言描述。我们随后提出若干新见解,揭示 ACC++ 带来的模型行为洞察。首先,我们利用 ACC++ 的可解释电路刻画 indirect object identification(IOI)电路对提示结构的敏感性。我们发现,提示特定电路形成明确的簇 clusters,跨簇间,注意力头接收到对应于识别 IO 名称不同机制的系统性不同信号。随后,在多语言 IOI 中,ACC++ 电路表明虽然模型组件在不同语言间被重用,但信号往往是语言特定的。在四语种 IOI 案例研究中,跨语言电路距离与语言关联性一致。综上,这些结果表明 ACC++ 能为广泛的模型行为提供解释。
引用
@article{arxiv.2602.13483,
title = {Finding Interpretable Prompt-Specific Circuits in Language Models},
author = {Gabriel Franco and Lucas M. Tassis and Azalea Rohr and Mark Crovella},
journal= {arXiv preprint arXiv:2602.13483},
year = {2026}
}