大提示词 regime 下 Softmax 注意力作为线性注意力:基于测度的视角
机器学习
2025-12-15 v1 机器学习
摘要
Softmax 注意力是 Transformer 架构的核心组件,但其非线性结构为理论分析带来了重大挑战。我们发展了一个统一的、基于测度的框架,用于研究单层 softmax 注意力在有限和无限提示词下的行为。对于独立同分布的高斯输入,我们利用 softmax 算子在无限提示词极限下收敛到作用于底层输入-token 测度的线性算子这一事实。基于这一洞察,我们建立了 softmax 注意力输出与梯度的非渐近集中界,量化了有限提示词模型向其无限提示词对应物收敛的速度,并证明该集中性在具有次高斯 token 的一般上下文学习设置中沿整个训练轨迹保持稳定。在上下文线性回归的情形下,我们利用可处理的无限提示词动力学来分析有限提示词长度下的训练。我们的结果表明,当提示词足够长时,针对线性注意力发展的优化分析可以直接迁移到 softmax 注意力,从而证明大提示词 softmax 注意力继承了其线性对应物的分析结构。这反过来为研究大提示词 regime 下 softmax 注意力层的训练动力学和统计行为提供了一个原理性的、广泛适用的工具包。
引用
@article{arxiv.2512.11784,
title = {Softmax as Linear Attention in the Large-Prompt Regime: a Measure-based Perspective},
author = {Etienne Boursier and Claire Boyer},
journal= {arXiv preprint arXiv:2512.11784},
year = {2025}
}