中文

注意力在零样本学习中的时间依赖性:归纳头的作用

计算与语言 2026-04-02 v1 人工智能

摘要

大型语言模型(LLMs)表现出强大的零样本学习能力,但它们如何跟踪和检索上下文中的信息仍然未被充分探讨。本文借鉴认知科学中的自由回忆范式(参与者以任意顺序回忆列表项),展示了几个开源 LLMs 持续显示出类序列回忆的模式:为输入序列中重复标记紧随其后的标记分配最高概率。通过系统性消融实验,我们表明归纳头——即注意力头中专门关注当前标记之前出现标记后续标记的头——在这一现象中发挥重要作用。消除具有高归纳得分的头会显著降低 +1 延迟偏差,而消除随机头则未能复现相同的降低。我们还表明,消除具有高归纳得分的头会更大程度地损害使用 few-shot 学习进行序列回忆的模型性能。我们的发现突显了归纳头与变换器中时间上下文处理之间的机制性特定联系,表明这些头在零样本学习期间尤其重要,用于有序检索和类序列回忆行为。

关键词

引用

@article{arxiv.2604.01094,
  title  = {Temporal Dependencies in In-Context Learning: The Role of Induction Heads},
  author = {Anooshka Bajaj and Deven Mahesh Mistry and Sahaj Singh Maini and Yash Aggarwal and Billy Dickson and Zoran Tiganj},
  journal= {arXiv preprint arXiv:2604.01094},
  year   = {2026}
}