softmax 回归中上下文学习与权重偏移的相似性
计算与语言
2023-04-27 v1 机器学习
摘要
大型语言模型(LLMs)以其在自然语言处理中的卓越表现而闻名,使其在诸多与人类生活甚至工作相关的任务中极为有效。Transformer 架构中的注意力机制是 LLMs 的关键组件,因为它允许模型选择性地聚焦于特定输入部分。softmax 单元作为注意力机制的关键部分,对注意力分数进行归一化。因此,LLMs 在各种 NLP 任务中的表现显著依赖于带 softmax 单元的注意力机制所发挥的关键作用。上下文学习作为近期 LLMs 的著名能力之一,是查询 ChatGPT 等 LLMs 的重要概念。无需进一步参数更新,Transformers 即可基于少量上下文示例学习预测。然而,Transformers 为何成为上下文学习者尚不清晰。近期若干工作 [ASA+22,GTLV22,ONR+22] 基于线性回归公式 从数学视角研究了上下文学习,表明 Transformers 具备在上下文中学习线性函数的能力。本工作中,我们基于 Transformer 注意力机制的 softmax 回归公式 研究上下文学习。我们给出了由单一自注意力层以及由 softmax 预测函数的 回归损失上的梯度下降所诱导的数据变换的上界,这意味着当为基回归任务训练仅自注意力的 Transformers 时,梯度下降学习的模型与 Transformers 表现出极大相似性。
引用
@article{arxiv.2304.13276,
title = {The Closeness of In-Context Learning and Weight Shifting for Softmax Regression},
author = {Shuai Li and Zhao Song and Yu Xia and Tong Yu and Tianyi Zhou},
journal= {arXiv preprint arXiv:2304.13276},
year = {2023}
}