中文

面向注意力机制的上下文学习:通过张量技巧从单一 Softmax 回归到多重 Softmax 回归

机器学习 2023-07-06 v1

摘要

大语言模型(LLMs)为人类社会带来了显著且变革性的变化。这些模型在自然语言理解与生成方面展现出卓越能力,并在多个领域推动了各种进展与影响。本文在两种与注意力相关回归的表述下考虑上下文学习。给定矩阵 A1Rn×dA_1 \in \mathbb{R}^{n \times d}A2Rn×dA_2 \in \mathbb{R}^{n \times d}BRn×nB \in \mathbb{R}^{n \times n},目标是求解某些优化问题:归一化版本 minXD(X)1exp(A1XA2)BF2\min_{X} \| D(X)^{-1} \exp(A_1 X A_2^\top) - B \|_F^2 与重缩放版本 exp(A1XA2)D(X)BF2\| \exp(A_1 X A_2^\top) - D(X) \cdot B \|_F^2。此处 D(X):=diag(exp(A1XA2)1n)D(X) := \mathrm{diag}( \exp(A_1 X A_2^\top) {\bf 1}_n )。我们的回归问题与以往关于 softmax 相关回归的研究有相似之处。先前研究已广泛探讨与 softmax 回归相关的回归技术:归一化版本 exp(Ax),1n1exp(Ax)b22\| \langle \exp(Ax) , {\bf 1}_n \rangle^{-1} \exp(Ax) - b \|_2^2 与重缩放版本 exp(Ax)exp(Ax),1nb22\| \exp(Ax) - \langle \exp(Ax), {\bf 1}_n \rangle b \|_2^2。与以往方法不同,我们采用向量化技术处理矩阵形式下的回归问题。该方法将维度从 dd 扩展至 d2d^2,类似于前述回归问题的表述。在完成回归函数的 Lipschitz 分析后,我们得出了关于上下文学习的主要结果。

关键词

引用

@article{arxiv.2307.02419,
  title  = {In-Context Learning for Attention Scheme: from Single Softmax Regression to Multiple Softmax Regression via a Tensor Trick},
  author = {Yeqi Gao and Zhao Song and Shenghao Xie},
  journal= {arXiv preprint arXiv:2307.02419},
  year   = {2023}
}