Transformer语言模型中跨任务的电路组件复用
计算与语言
2024-05-07 v3 机器学习
摘要
机制可解释性(mechanistic interpretability)的近期研究表明,语言模型中的行为可以通过电路分析成功逆向工程。然而,一个常见的批评是,每个电路都是任务特定的,因此此类分析无法有助于在更高层次上理解模型。在这项工作中,我们提出证据表明,洞察(既包含关于特定注意力头(head)的低层发现,也包含关于通用算法的高层发现)确实可以跨任务泛化。具体而言,我们研究了 Wang 等人(2022)为间接对象识别(Indirect Object Identification, IOI)任务发现的电路,并 1.) 表明它在更大的 GPT2 模型上复现,以及 2.) 表明它大部分被复用以解决一个看似不同的任务:彩色对象(Colored Objects,Ippolito & Callison-Burch, 2023)。我们提供的证据表明,两个任务背后的过程在功能上非常相似,并且电路内注意力头的重叠度约为 78%。我们进一步提出了一个概念验证干预实验,其中我们调整中间层的四个注意力头,以“修复”彩色对象电路并使其表现得像 IOI 电路。在此过程中,我们将彩色对象任务上的准确率从 49.6% 提升到 93.7%,并解释了大多数错误来源。该干预以 IOI 电路中相互作用所预测的特定方式影响下游注意力头,表明该子电路行为对于不同的任务输入是不变的。总体而言,我们的结果为以下可能性提供了证据:或许仍可以用相对较少的可解释任务通用算法构建块和计算组件来解释大语言模型的行为。
引用
@article{arxiv.2310.08744,
title = {Circuit Component Reuse Across Tasks in Transformer Language Models},
author = {Jack Merullo and Carsten Eickhoff and Ellie Pavlick},
journal= {arXiv preprint arXiv:2310.08744},
year = {2024}
}
备注
Accepted at ICLR 2024