泛化还是幻觉?理解Transformer中的上下文外推理
计算与语言
2026-02-03 v4 机器学习
摘要
大语言模型(LLMs)可以通过微调获取新知识,但这一过程表现出一种令人困惑的二元性:模型可以从新事实中显著泛化,但也容易产生错误的幻觉。然而,这一现象的原因仍知之甚少。在本研究中,我们论证这两种行为均源于一种称为上下文外推理(OCR)的单一机制:通过关联概念来推导隐含含义的能力,即使这些概念之间没有因果联系。我们在五个著名 LLM 上的实验证实,OCR 确实同时驱动泛化和幻觉,取决于所关联的概念是否具有因果关系。为了建立对这一现象的严格理论理解,我们将 OCR 形式化为一个合成事实回忆任务。我们从经验上证明,一个单层单头注意力-only Transformer 配合因子化的输出矩阵和值矩阵可以学会解决该任务,而权重合并的模型则不能,这突显了矩阵分解的关键作用。我们的理论分析表明,OCR 能力可归因于梯度下降的隐式偏置,该偏置倾向于最小化合并输出-值矩阵的核范数的解。这一数学结构解释了为什么模型能够以高样本效率学习关联事实与隐含含义,无论这种相关性是因果性的还是仅仅是虚假的。最终,我们的工作为理解 OCR 现象提供了理论基础,为分析和缓解知识注入所导致的不良行为提供了一个新视角。
引用
@article{arxiv.2506.10887,
title = {Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers},
author = {Yixiao Huang and Hanlin Zhu and Tianyu Guo and Jiantao Jiao and Somayeh Sojoudi and Michael I. Jordan and Stuart Russell and Song Mei},
journal= {arXiv preprint arXiv:2506.10887},
year = {2026}
}
备注
NeurIPS 2025, first three authors contributed equally