提取 Transformer 中注意力特征的基于规则的描述
计算与语言
2025-10-22 v1 机器学习
摘要
机制可解释性致力于从自下而上的原语角度解释模型行为。主流范式是将隐藏状态表示为基向量(称为特征)的稀疏线性组合。然而,这只能识别哪些文本序列(示例)激活了哪些特征;特征的实际解释需要对这些示例进行主观检查。本文提倡一种不同的解决方案:基于规则的描述,匹配输入中的 token 模式并相应地增加或减少特定输出 token 的可能性。具体来说,我们提取在注意力层输出上训练的 SAE 特征的基于规则的描述。虽然先前的工作将注意力层视为一个不透明的盒子,但我们描述了它如何自然地用输入和输出特征之间的相互作用来表达,我们研究了三种类型:(1)skip-gram 规则,形式为“[加拿大城市]... 说 --> 英语”,(2)缺失规则,形式为“[蒙特利尔]... 说 -/-> 英语”,以及(3)计数规则,仅当某个词的计数超过某个值或另一个词的计数时切换。缺失和计数规则不容易通过检查示例来发现,而手动和自动描述通常识别出误导或不完整的解释。然后,我们描述了一种简单的方法,从 transformer 中自动提取这些类型的规则,并将其应用于 GPT-2 small。我们发现,大多数特征可以用大约 100 条 skip-gram 规则很好地描述,尽管缺失规则即使在第一层也很丰富(超过四分之一的特征)。我们还分离出了一些计数规则的例子。本文通过定义基于规则的特征描述、展示如何提取它们,并提供它们所代表的一些行为的初步分类,为未来研究奠定了基础。
引用
@article{arxiv.2510.18148,
title = {Extracting Rule-based Descriptions of Attention Features in Transformers},
author = {Dan Friedman and Adithya Bhaskar and Alexander Wettig and Danqi Chen},
journal= {arXiv preprint arXiv:2510.18148},
year = {2025}
}
备注
Our code is available at https://github.com/princeton-nlp/AttentionRules