中文

softmax 回归中上下文学习与权重偏移的相似性

计算与语言 2023-04-27 v1 机器学习

摘要

大型语言模型(LLMs)以其在自然语言处理中的卓越表现而闻名,使其在诸多与人类生活甚至工作相关的任务中极为有效。Transformer 架构中的注意力机制是 LLMs 的关键组件,因为它允许模型选择性地聚焦于特定输入部分。softmax 单元作为注意力机制的关键部分,对注意力分数进行归一化。因此,LLMs 在各种 NLP 任务中的表现显著依赖于带 softmax 单元的注意力机制所发挥的关键作用。上下文学习作为近期 LLMs 的著名能力之一,是查询 ChatGPT 等 LLMs 的重要概念。无需进一步参数更新,Transformers 即可基于少量上下文示例学习预测。然而,Transformers 为何成为上下文学习者尚不清晰。近期若干工作 [ASA+22,GTLV22,ONR+22] 基于线性回归公式 minxAxb2\min_x\| Ax - b \|_2 从数学视角研究了上下文学习,表明 Transformers 具备在上下文中学习线性函数的能力。本工作中,我们基于 Transformer 注意力机制的 softmax 回归公式 minxexp(Ax),1n1exp(Ax)b2\min_{x} \| \langle \exp(Ax), {\bf 1}_n \rangle^{-1} \exp(Ax) - b \|_2 研究上下文学习。我们给出了由单一自注意力层以及由 softmax 预测函数的 2\ell_2 回归损失上的梯度下降所诱导的数据变换的上界,这意味着当为基回归任务训练仅自注意力的 Transformers 时,梯度下降学习的模型与 Transformers 表现出极大相似性。

关键词

引用

@article{arxiv.2304.13276,
  title  = {The Closeness of In-Context Learning and Weight Shifting for Softmax Regression},
  author = {Shuai Li and Zhao Song and Yu Xia and Tong Yu and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2304.13276},
  year   = {2023}
}