从参数推断注意力头的功能
计算与语言
2025-06-03 v2
摘要
注意力头是大型语言模型 (LLMs) 的基本构建模块之一。先前关于研究其运作的工作主要集中在分析它们在特定电路或任务推理期间的行为。在本工作中,我们寻求对它们在模型中实现的操作的全面映射。我们提出了 MAPS(注意力头参数映射,Mapping Attention head ParameterS),这是一个高效的框架,无需任何模型训练或推理即可从参数推断注意力头的功能。我们展示了 MAPS 在回答两类问题上的效用:(a) 给定预定义操作,映射模型中各注意力头实现该操作的强度;(b) 给定一个注意力头,推断其显著功能。在 6 个流行的 LLMs 中的 20 个操作上对 MAPS 的评估表明,其估计值与推理期间注意力头的输出相关,且与模型的预测存在因果联系。此外,其映射揭示了先前研究中被忽视的某些操作的注意力头,以及关于 LLMs 中功能普适性和架构偏见的宝贵见解。接下来,我们提出了一条自动流水线及相关分析,利用 MAPS 来表征给定注意力头的显著操作。我们的流水线为大多数注意力头生成了合理的操作描述,如人工评估所判定的那样,同时揭示了多样化的操作。
引用
@article{arxiv.2412.11965,
title = {Inferring Functionality of Attention Heads from their Parameters},
author = {Amit Elhelo and Mor Geva},
journal= {arXiv preprint arXiv:2412.11965},
year = {2025}
}
备注
ACL 2025 Main