中文

变换器不在上下文中学习最小二乘回归

机器学习 2025-07-15 v1 人工智能

摘要

在上下文学习(ICL)已成为大型预训练变换器的强大能力,使其能够在无需任何梯度更新的情况下,通过隐式地在示例输入输出对中解决新任务。尽管其实际应用屡屡成功,但ICL背后的机制仍然鲜为人知。本文通过研究合成线性回归来探究变换器如何在推理时实现学习。先前的研究表明,变换器的性能匹配普通最小二乘(OLS)回归或梯度下降等学习规则,并建议ICL通过变换器实现这些技术之一来实现。在本工作中,我们通过一系列超出分布的泛化实验表明,针对ICL训练的变换器在提示分布发生偏移后无法泛化,这一行为与变换器实现诸如OLS等算法的假设不符。最后,我们通过对在残差流中所学表示的谱分析,突出了预训练语料库在塑造ICL行为中的作用。来自相同分布的输入在表示上具有独特的谱特征:来自该分布的输入倾向于具有相同的前两个奇异向量。这种谱特征并不被超出分布的输入共享,描述该特征存在的度量与低损失高度相关。

关键词

引用

@article{arxiv.2507.09440,
  title  = {Transformers Don't In-Context Learn Least Squares Regression},
  author = {Joshua Hill and Benjamin Eyre and Elliot Creager},
  journal= {arXiv preprint arXiv:2507.09440},
  year   = {2025}
}

备注

21 pages, 16 figures, ICML 2025 Workshop on Reliable and Responsible Foundation Models