中文

注意力机制中的最大间隔 token 选择

机器学习 2023-12-11 v4 人工智能 计算与语言 最优化与控制

摘要

注意力机制是 transformer 架构的核心组件,它带来了大语言模型的惊人成功。然而,注意力机制背后的理论原理,尤其是其非凸优化动力学,仍知之甚少。本工作中,我们探究开创性的 softmax 注意力模型 f(X)=Xv,softmax(XWp)f(\boldsymbol{X})=\langle \boldsymbol{Xv}, \texttt{softmax}(\boldsymbol{XWp})\rangle,其中 X\boldsymbol{X} 为 token 序列, (v,W,p)(\boldsymbol{v},\boldsymbol{W},\boldsymbol{p}) 为可训练参数。我们证明,对 p\boldsymbol{p} 或等价地对 W\boldsymbol{W} 运行梯度下降,会在方向上收敛到一个最大间隔解,该解将局部最优 token 与非最优 token 分离。这明确地将注意力形式化为一种最优 token 选择机制。值得注意的是,我们的结果适用于一般数据,并根据值嵌入 Xv\boldsymbol{Xv} 与问题几何精确刻画了 token 的最优性。我们还提供了更宽泛的正则化路径分析,确立了即使对于非线性预测头,注意力也具有间隔最大化性质。当使用 logistic 损失同时优化 v\boldsymbol{v}p\boldsymbol{p} 时,我们识别出若干条件,在这些条件下正则化路径在方向上收敛到各自的硬间隔 SVM 解,其中 v\boldsymbol{v} 根据其标签分离输入特征。有趣的是, p\boldsymbol{p} 的 SVM 表述受 v\boldsymbol{v} 的支撑向量几何影响。最后,我们通过数值实验验证了理论发现并提供了见解。

关键词

引用

@article{arxiv.2306.13596,
  title  = {Max-Margin Token Selection in Attention Mechanism},
  author = {Davoud Ataee Tarzanagh and Yingcong Li and Xuechen Zhang and Samet Oymak},
  journal= {arXiv preprint arXiv:2306.13596},
  year   = {2023}
}

备注

Revised proof of Theorem 2 - Gradient descent path globally converges only when n=1