初始化决定了准近然学习是否为梯度下降
机器学习
2025-12-05 v1 人工智能
摘要
准近学习 (ICL) 在大型语言模型 (LLM) 中表现突出,但其背后的机制仅部分被理解。以往的工作将线性自注意力 (LSA) 与梯度下降 (GD) 联系起来,这一联系主要是在简化条件下建立的,即零均值高斯先验和 GD 的零初始化。然而,后续研究通过指出其过于限制性假设,特别是当考虑多层或非线性注意力时,自注意力执行类似但不同于 GD 的优化式推断。我们研究多头 LSA 在更真实条件下如何近似 GD,具体关注在包含非零高斯先验均值的线性回归 ICL 公式中。我们首先通过引入查询的初始估计量来扩展多头 LSA 嵌入矩阵。我们证明了在 ICL 线性回归设置中所需头数的上界。我们的实验确认了这一结果,并进一步观察到一阶 GD 与多头 LSA 之间存在性能差距。为弥补这一差距,我们引入 yq-LSA,这是一种单头 LSA 的简单推广,带有可训练的初始估计量 yq。我们理论上确立了 yq-LSA 的能力,并在线性回归任务上提供实验验证,从而扩展了连接 ICL 与 GD 的理论。最后,受我们在线性回归情形中的发现启发,我们考虑广泛的 LLM 增强了初始估计能力的模型,并在语义相似性任务上显示其性能得到提高。
引用
@article{arxiv.2512.04268,
title = {The Initialization Determines Whether In-Context Learning Is Gradient Descent},
author = {Shifeng Xie and Rui Yuan and Simone Rossi and Thomas Hannagan},
journal= {arXiv preprint arXiv:2512.04268},
year = {2025}
}