反事实推理:上下文涌现的分析
计算与语言
2025-10-22 v2 人工智能
机器学习
统计理论
统计理论
摘要
大规模神经语言模型在上下文学习方面表现出显著能力:能够即时学习和推理输入上下文。本研究探讨语言模型中的上下文反事实推理,即预测假设情景后果的能力。我们聚焦于一个定义明确的合成线性回归任务,该任务需要噪声推断。准确预测依赖于(1)推断未观测到的潜在概念和(2)从事实观测中复制上下文噪声。我们证明语言模型具备反事实推理能力。进一步,我们增强了现有可识别性结果,并将广泛函数类的反事实推理归约为上下文观测上的变换。在Transformer中,我们发现自注意力、模型深度和预训练数据多样性驱动性能。此外,我们提供了机制性证据,表明潜在概念在残差流中线性表示,并引入了专门用于执行反事实推理的"噪声推断头"。最后,我们的发现扩展至SDE动力学下的反事实推理,并反映Transformer能够对序列数据执行噪声推断,为反事实故事生成的潜力提供了初步证据。我们的代码托管于 https://github.com/mrtzmllr/iccr。
引用
@article{arxiv.2506.05188,
title = {Counterfactual reasoning: an analysis of in-context emergence},
author = {Moritz Miller and Bernhard Schölkopf and Siyuan Guo},
journal= {arXiv preprint arXiv:2506.05188},
year = {2025}
}
备注
Published as a conference paper at the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS) 2025