中文

解构多头 Softmax 注意力在线性回归中的 In-Context 学习

机器学习 2025-05-29 v2 机器学习

摘要

我们研究多头 Softmax 注意力模型如何在线性数据上进行 in-context 学习。通过大量经验实验和严格的理论分析,我们阐明了优雅注意力模式的出现:在 key-query (KQ) 权重中呈现对角线和均匀性模式,在 output-value (OV) 权重中呈现仅最后一个条目和零和模式。值得注意的是,这些模式始终从随机初始化的梯度-based 训练中出现。我们的分析表明,这些涌现结构使多头注意力大致实现一个去偏置的梯度下降预测器——该预测器优于单头注意力,并几乎达到贝叶斯最优(相对于比例因子)。此外,与线性 Transformer 相比,Softmax 注意力能够轻松地推广到训练期间未见过的更长序列。我们还将研究扩展到各向异性协变量和多任务线性回归的情形。在前者中,多头注意力学习实现了一种形式的预条件梯度下降。在后者中,我们发现一种有趣的 regime,其中头数与任务数的相互作用触发了一种叠加现象,有效解决了多任务 in-context 学习。我们的结果表明,in-context 学习能力是作为其架构和底层数据分布的综合效应从训练后的 Transformer 中涌现出来的,为更深入地理解 and 更广泛地应用 in-context 学习 paving the way for deeper understanding and broader applications of in-context learning。

关键词

引用

@article{arxiv.2503.12734,
  title  = {In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention},
  author = {Jianliang He and Xintian Pan and Siyu Chen and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2503.12734},
  year   = {2025}
}

备注

Accepted by ICML 2025, related work added