层次化专家混合模型中的专家估计:超越 Softmax 门控函数
机器学习
2025-03-10 v2 机器学习
摘要
随着混合专家(Mixture of Experts, MoE)架构在开发大规模基础模型方面的日益突出,我们研究了层次化混合专家(Hierarchical Mixture of Experts, HMoE),这是一种专门用于处理复杂输入并提高特定任务性能的 MoE 变体。我们的分析突出了在 HMoE 框架中使用拉普拉斯门控函数相对于传统 Softmax 门控函数的优势。我们理论上表明,在 HMoE 模型的两个层面上应用拉普拉斯门控函数可消除由 Softmax 门控函数引起的不寻常参数相互作用,从而加速专家收敛并提高专家专业化。实证验证在多种场景下均支持这些理论主张,包括大规模多模态任务、图像分类和潜在领域发现与预测任务,其中我们修改后的 HMoE 模型在众多方面均优于常规 HMoE 模型。
引用
@article{arxiv.2410.02935,
title = {On Expert Estimation in Hierarchical Mixture of Experts: Beyond Softmax Gating Functions},
author = {Huy Nguyen and Xing Han and Carl Harris and Suchi Saria and Nhat Ho},
journal= {arXiv preprint arXiv:2410.02935},
year = {2025}
}
备注
Huy Nguyen and Xing Han contributed equally to this work