面向注意力机制的上下文学习:通过张量技巧从单一 Softmax 回归到多重 Softmax 回归
机器学习
2023-07-06 v1
摘要
大语言模型(LLMs)为人类社会带来了显著且变革性的变化。这些模型在自然语言理解与生成方面展现出卓越能力,并在多个领域推动了各种进展与影响。本文在两种与注意力相关回归的表述下考虑上下文学习。给定矩阵 、 和 ,目标是求解某些优化问题:归一化版本 与重缩放版本 。此处 。我们的回归问题与以往关于 softmax 相关回归的研究有相似之处。先前研究已广泛探讨与 softmax 回归相关的回归技术:归一化版本 与重缩放版本 。与以往方法不同,我们采用向量化技术处理矩阵形式下的回归问题。该方法将维度从 扩展至 ,类似于前述回归问题的表述。在完成回归函数的 Lipschitz 分析后,我们得出了关于上下文学习的主要结果。
引用
@article{arxiv.2307.02419,
title = {In-Context Learning for Attention Scheme: from Single Softmax Regression to Multiple Softmax Regression via a Tensor Trick},
author = {Yeqi Gao and Zhao Song and Shenghao Xie},
journal= {arXiv preprint arXiv:2307.02419},
year = {2023}
}