中文

Transformer 中上下文事实回忆的微调动力学

机器学习 2026-05-28 v1

摘要

上下文学习——基于提示中给出的示例执行任务——是大语言模型中出现的一项重要能力,并在理论和实践中都受到了广泛关注。现有的理论工作通常侧重于学习仅使用提示中信息的场景。然而,许多上下文学习的实际实例要求模型检索存储在其参数中的事实知识,而上下文则用于识别哪些知识是相关的。在这项工作中,我们研究上下文学习如何利用事实知识回忆。我们通过引入“上下文事实回忆(IC-recall)”任务来形式化这一行为,其中向 Transformer 提供从隐藏关系中生成的(主语,答案)对上下文以及一个查询主语,它必须同时推断出这个隐藏关系并检索相应的答案。事实知识通过 Transformer 访问一个简单的预构建 MLP 联想记忆来建模,该记忆存储(主语,关系,答案)三元组。我们分析了单层 Transformer 在 IC-recall 数据上的监督微调动力学,并证明模型通过收敛到特定的成对注意力模式成功执行了 IC-recall。这个微调阶段只需要非常少量的样本——仅与存储的知识三元组数量成多对数关系。实验验证了我们的理论预测,并表明即使 MLP 层是预训练而非构建的,成对注意力模式也会出现。

关键词

引用

@article{arxiv.2605.27774,
  title  = {Fine-Tuning Dynamics of In-Context Factual Recall in Transformers},
  author = {Ruomin Huang and Eshaan Nichani and Jason D. Lee and Rong Ge},
  journal= {arXiv preprint arXiv:2605.27774},
  year   = {2026}
}