In-Context Learning 中的归纳头的出现
人工智能
2026-01-12 v2 计算与语言
摘要
Transformer 已成为自然语言处理领域的主导架构。其成功的一部分归功于一种被称为 in-Context 学习 (ICL) 的惊人能力:它们能够仅凭输入上下文获取并应用新关联,而无需更新权重。在本工作中,我们研究了归纳头的出现,这是一种在两层 Transformer 中先前确认的机制,对 ICL 尤其重要。在我们发现的简单且可解释的结构中实现了归纳头的权重矩阵。我们通过最小化 ICL 任务公式和修改的 Transformer 架构理论解释了这一结构的来源。我们给出训练动力学受限于参数空间 19 维子空间的形式证明。经验上,我们验证了这一约束,同时观察到只有 3 个维度 accounted for 归纳头的出现。通过进一步研究这个 3 维子空间内的训练动力学,我们发现归纳头出现的时间遵循一个严格的渐近界,呈线性于输入上下文长度的平方。
引用
@article{arxiv.2511.01033,
title = {On the Emergence of Induction Heads for In-Context Learning},
author = {Tiberiu Musat and Tiago Pimentel and Lorenzo Noci and Alessandro Stolfo and Mrinmaya Sachan and Thomas Hofmann},
journal= {arXiv preprint arXiv:2511.01033},
year = {2026}
}