注意力层在单位置回归问题中可证明地获得最优解
机器学习
2025-02-27 v2 机器学习
摘要
注意力模型(如 Transformer)在 various 任务中表现出色,但关于 token 稀疏性和内部线性表示的理论理解仍不充分。为此,我们提出单位置回归任务,其中序列中仅有一个 token 决定输出,其位置是随机变量,可通过输入的线性投影获取。为解决此任务,我们提出专用预测器,其实质为非线性自注意力层的简化版本。我们对其理论属性进行研究,证明其渐近贝叶斯最优性,并分析了训练动力学。特别地,尽管问题本身非凸,预测器能够有效学习底层结构。本工作凸显了注意力机制处理稀疏 token 信息和内部线性结构的能力。
引用
@article{arxiv.2410.01537,
title = {Attention layers provably solve single-location regression},
author = {Pierre Marion and Raphaël Berthier and Gérard Biau and Claire Boyer},
journal= {arXiv preprint arXiv:2410.01537},
year = {2025}
}
备注
42 pages, 10 figures. Accepted to ICLR 2025