中文

无复制的情境学习

计算与语言 2026-02-11 v2

摘要

情境学习 (in-context learning) 是大语言模型中的一种关键能力,其机制可能涉及诱导头 (induction heads) 的作用。诱导头通过匹配早期上下文中的模式来进行逐字复制,从而导致训练损失急剧下降。这被视为诱导头可能支撑广泛情境学习能力的证据。在本研究中,我们探讨了诱导头是否是学习抽象情境学习能力(即答案不包含在输入上下文中)的必要构件,或这些能力是否可以独立涌现。我们提出了 Hapax 训练方案,通过消除可被诱导头预测的标记的损失贡献来实现。尽管抽象情境学习能力得以保留,模型在 21 个任务中以 13 个任务的更高准确率表现优于基础模型,尽管 31.7% 的标记被省略损失。此外,本模型在诱导头无法预测的位置上实现了更低的损失值。机制分析显示,采用 Hapax 训练的模型发展出更少且更弱的诱导头,尽管保留了抽象情境学习能力。我们的发现表明,诱导头与抽象情境学习能力之间的发展关系比此前假设的更弱。

关键词

引用

@article{arxiv.2511.05743,
  title  = {In-Context Learning Without Copying},
  author = {Kerem Sahin and Sheridan Feucht and Adam Belfki and Jannik Brinkmann and Aaron Mueller and David Bau and Chris Wendler},
  journal= {arXiv preprint arXiv:2511.05743},
  year   = {2026}
}