中文

在混合专家中Sigmoid门控比Softmax门控具有更高的样本效率

机器学习 2024-11-05 v3 机器学习

摘要

softmax门控函数可以说是混合专家建模中最流行的选择。尽管在实践中广泛使用,但softmax门控可能导致专家之间不必要的竞争,由于其固有结构可能引起表示崩溃的不良现象。作为回应,最近提出了sigmoid门控函数作为替代,并且经验证明其性能更优。然而,当前文献中缺乏对sigmoid门控函数的严格检验。在本文中,我们从理论上验证了sigmoid门控在专家估计的统计任务中实际上比softmax门控具有更高的样本效率。为此,我们考虑一个回归框架,其中未知回归函数被建模为混合专家,并研究在过指定情况(即拟合专家数量大于真实值)下最小二乘估计量的收敛速度。我们表明自然会出现两种门控机制,并且在每种机制中,我们为专家函数制定了可识别性条件,并推导了相应的收敛速度。在两种情况下,我们发现使用常用激活函数(如ReLU和GELU)的前馈网络形式的专家在sigmoid门控下比在softmax门控下具有更快的收敛速度。此外,在相同的专家选择下,我们证明sigmoid门控函数需要比softmax门控更小的样本量才能达到相同的专家估计误差,因此样本效率更高。

关键词

引用

@article{arxiv.2405.13997,
  title  = {Sigmoid Gating is More Sample Efficient than Softmax Gating in Mixture of Experts},
  author = {Huy Nguyen and Nhat Ho and Alessandro Rinaldo},
  journal= {arXiv preprint arXiv:2405.13997},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024, 26 pages