通过隐藏状态几何统一注意力头与任务向量:基于In-Context Learning中的注意力机制
计算与语言
2025-10-21 v2
摘要
in-context learning(ICL)的异常特性促使人们深入探讨大型语言模型的内部机制。先前的工作通常关注特定层的特殊注意力头或任务向量,但缺乏将这些组件与跨层隐藏状态演化统一起来解释模型最终输出的框架。在本文中,我们提出了这样一种框架,用于ICL中的分类任务,通过分析两种支配性能的几何因素:查询隐藏状态的可分离性和对齐性。对层级演化的细粒度分析揭示了惊人的两阶段机制:可分离性在早期层中出现,而对齐性在后期层中发展。消融研究进一步表明,Previous Token Heads驱动可分离性,而Induction Heads和任务向量增强对齐性。我们的发现因此在注意力头和任务向量之间搭建了桥梁,提供了对ICL底层机制的统一解释。
引用
@article{arxiv.2505.18752,
title = {Unifying Attention Heads and Task Vectors via Hidden State Geometry in In-Context Learning},
author = {Haolin Yang and Hakaze Cho and Yiqiao Zhong and Naoya Inoue},
journal= {arXiv preprint arXiv:2505.18752},
year = {2025}
}
备注
52 pages, 70 figures, 24 tables, NeurIPS 2025