中文

二次门控混合专家:对自注意力机制的统计学洞见

机器学习 2025-07-10 v3 机器学习

摘要

混合专家 (MoE) 模型因有效放大模型容量而保持计算开销而广为人知。本文在严格的统计框架下建立了 MoE 与自注意力机制之间的关系,表明自注意力矩阵的每一行都可以表示为线性专家的二次门控混合。基于这一联系,我们对两种不同二次门控函数(即二次多项式门和二次单项式门)的 MoE 模型进行了详尽的收敛分析,为 MoE 框架中门控和专家设计提供了有用的见解。首先,我们的分析表明,采用二次单项式门相对于二次多项式门可提高估计参数和专家的样本效率。其次,在使用非线性专家代替线性专家后,参数和专家估计速率显著加快。结合上述 MoE 与自注意力之间的链接,我们提出了一种新颖的\emph{active-attention} 机制,对自注意力公式中的值矩阵应用非线性激活函数。最后,我们通过在各种任务上的大量实验表明,所提出的 active-attention 在图像分类、语言建模和多变量时间序列预测等任务中超越标准自注意力。

关键词

引用

@article{arxiv.2410.11222,
  title  = {Quadratic Gating Mixture of Experts: Statistical Insights into Self-Attention},
  author = {Pedram Akbarian and Huy Nguyen and Xing Han and Nhat Ho},
  journal= {arXiv preprint arXiv:2410.11222},
  year   = {2025}
}

备注

Pedram Akbarian, Huy Nguyen, and Xing Han made equal contributions to this work