中文

从概念到组件:面向 Transformer 的概念无关注意力模块发现

机器学习 2025-06-23 v1 人工智能 计算与语言

摘要

Transformer 在语言和视觉任务上取得了最先进的性能,这推动了以提升性能和改善行为控制为目标的解释其内部机制的紧迫需求。归因方法有助于提高可解释性,通过将与特定目标概念相关的模型输出分配给特定模型组件。当前的归因研究主要关注多层感知器神经元,处理相对简单的概念,如事实关联(例如巴黎位于法国)。这忽略了注意力机制的影响,缺乏统一的方法来分析更复杂的概念。为填补这一空白,本文引入 Scalable Attention Module Discovery (SAMD),一种面向任意复杂概念将其映射到通用 Transformer 模型特定注意力头的概念无关方法。我们通过将每个概念表示为向量,计算其与每个注意力头的余弦相似度,并选取得分最高的 TopK 个注意力头来构建与概念关联的注意力模块。随后,我们提出 Scalar Attention Module Intervention (SAMI),一种仅通过调整单个标量参数来增强或削弱概念效果的简单策略。经验上,我们在概念复杂度不同的集合上演示了 SAMD,并可视化了其对应模块的位置。我们的结果表明,模块位置在 LLM 微调前后保持稳定,并确认了先前工作关于 LLM 多语言性的机制。通过 SAMI,我们通过削弱“安全”概念实现对 HarmBench 的攻击成功率提升至 +72.7%,并通过放大“推理”概念在 GSM8K 基准上的性能提升至 +1.6%。最后,我们通过抑制视觉 Transformer 在 ImageNet 上的图像分类准确率,突出了我们方法的领域无关性。

关键词

引用

@article{arxiv.2506.17052,
  title  = {From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers},
  author = {Jingtong Su and Julia Kempe and Karen Ullrich},
  journal= {arXiv preprint arXiv:2506.17052},
  year   = {2025}
}