中文

Sigmoid自注意力比Softmax自注意力具有更低的样本复杂度:一种混合专家视角

机器学习 2025-05-27 v2 人工智能

摘要

流行的Transformer架构的核心是自注意力机制,它动态地为每个输入标记分配softmax权重,以便模型能够关注最显著的信息。然而,softmax结构由于其逐行计算的特性而减慢了注意力计算速度,并且它本质上引入了标记间的竞争:分配给一个标记的权重增加时,其他标记的权重就会减少。这种竞争动态可能会将自注意力的焦点缩小到有限的特征集,从而可能忽略其他信息性特征。最近的实验研究表明,使用逐元素的sigmoid函数有助于消除标记竞争并减少计算开销。尽管有这些有前景的实证结果,但文献中仍然缺乏对sigmoid和softmax自注意力机制的严格比较。本文通过从理论上证明sigmoid自注意力比其softmax对应机制更具样本效率,从而弥补了这一空白。为此,我们将自注意力矩阵表示为混合专家,并证明sigmoid自注意力中的“专家”需要显著更少的数据即可达到与softmax自注意力中的专家相同的逼近误差。

关键词

引用

@article{arxiv.2502.00281,
  title  = {Sigmoid Self-Attention has Lower Sample Complexity than Softmax Self-Attention: A Mixture-of-Experts Perspective},
  author = {Fanqi Yan and Huy Nguyen and Pedram Akbarian and Nhat Ho and Alessandro Rinaldo},
  journal= {arXiv preprint arXiv:2502.00281},
  year   = {2025}
}

备注

Fanqi Yan, Huy Nguyen contributed equally to this work. 49 pages, 2 figures, 1 table