通过注意力头分析局化任务识别与任务学习于情境学习中
计算与语言
2026-05-04 v3
摘要
我们通过整合注意力头的组件级分析与情境学习(ICL)分解为任务识别(Task Recognition, TR)和任务学习(Task Learning, TL)两大范式,来探究大型语言模型中情境学习的机制学基础。我们提出了基于任务子空间逻辑归因(Task Subspace Logit Attribution, TSLA)的新型框架,以识别专门负责TR和TL的注意力头,并展示它们具有独立且互补的作用。通过相关性分析、消融研究和输入扰动,我们表明所识别的TR头与TL头能够分别且有效地捕捉ICL的TR和TL组成部分。利用几何分析隐藏状态的驾驶实验,我们揭示TR头通过将隐藏状态对齐至任务子空间来促进任务识别,而TL头则通过在子空间内旋转隐藏状态以指向正确标签来促进预测。我们进一步展示了如何将前人关于ICL机制的发现(包括归纳头与任务向量)与我们的注意力头层级的TR-TL分解分析相统一。因此,我们的框架提供了一套统一且可解释的解释框架,说明大型语言模型如何在多样化任务与情境下执行情境学习。
引用
@article{arxiv.2509.24164,
title = {Localizing Task Recognition and Task Learning in In-Context Learning via Attention Head Analysis},
author = {Haolin Yang and Hakaze Cho and Naoya Inoue},
journal= {arXiv preprint arXiv:2509.24164},
year = {2026}
}
备注
ICLR 2026