中文

混合机制:语言模型如何在上下文中检索绑定实体

计算与语言 2026-05-29 v2

摘要

上下文推理的一个关键组成部分是语言模型(LM)能够为后续检索绑定实体的能力。例如,LM 可能通过将 "Ann" 绑定到 "pie" 来表示 "Ann loves pie",从而在被问及 "Who loves pie?" 时检索 "Ann"。先前针对绑定实体的短列表的研究发现,LM 通过位置机制实现此类检索具有强烈证据,即 "Ann" 根据其在上下文中的位置被检索。在本工作中,我们发现该机制在更复杂情形下的泛化能力较差;随着绑定实体在上下文中的数量增加,位置机制在中间位置变得嘈杂且不可靠。为补偿这一不足,我们发现 LM 通过词汇机制(检索与其绑定对应项 "pie" 的 "Ann")以及反射机制(通过直接指针检索 "Ann")来补充位置机制。通过针对九个模型和十个绑定任务进行大量实验,我们发现 LM 在驱动模型行为方面混合运用这些机制时存在一致模式。我们利用这些见解开发了一种结合所有三种机制的因果模型,预测下一个标记分布的 agreement 达到 95%。最后,我们表明该模型可扩展至大量开放式文本输入,这些输入交错包含实体组,从而进一步证明了我们的发现在更自然情形下的稳健性。总体而言,本研究描绘了 LM 在上下文中绑定与检索实体的更完整图景。

关键词

引用

@article{arxiv.2510.06182,
  title  = {Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context},
  author = {Yoav Gur-Arieh and Mor Geva and Atticus Geiger},
  journal= {arXiv preprint arXiv:2510.06182},
  year   = {2026}
}

备注

Accepted to ICLR 2026 Main Conference