中文

线性 Transformer 块的上下文学习:MLP 组件的优势与一步梯度下降初始化

机器学习 2024-02-26 v1 计算与语言 机器学习

摘要

我们研究了结合线性注意力组件和线性多层感知机 (MLP) 组件的线性 Transformer 块 (LTB) 的上下文学习 (ICL) 能力。对于具有高斯先验和非零均值的线性回归的 ICL,我们表明 LTB 可以实现近乎贝叶斯最优的 ICL 风险。相比之下,仅使用线性注意力必然会产生不可约的加性近似误差。此外,我们建立了 LTB 与具有可学习初始化 (GD-β\mathsf{GD}\text{-}\mathbf{\beta}) 的一步梯度下降估计器之间的对应关系,即每个 GD-β\mathsf{GD}\text{-}\mathbf{\beta} 估计器均可由 LTB 估计器实现,且每个最小化类内 ICL 风险的最优 LTB 估计器实际上都是 GD-β\mathsf{GD}\text{-}\mathbf{\beta} 估计器。最后,我们表明,尽管训练目标是非凸的,GD-β\mathsf{GD}\text{-}\mathbf{\beta} 估计器仍可通过梯度流进行高效优化。我们的结果揭示了 LTB 通过实现 GD-β\mathsf{GD}\text{-}\mathbf{\beta} 来完成 ICL,并突出了 MLP 层在减少近似误差中的作用。

关键词

引用

@article{arxiv.2402.14951,
  title  = {In-Context Learning of a Linear Transformer Block: Benefits of the MLP Component and One-Step GD Initialization},
  author = {Ruiqi Zhang and Jingfeng Wu and Peter L. Bartlett},
  journal= {arXiv preprint arXiv:2402.14951},
  year   = {2024}
}

备注

39 pages