中文

稀疏专家混合模型:稀疏性最优性的实证证据与理论基础

机器学习 2025-06-17 v2

摘要

稀疏专家混合模型(SMoE)因其在不按比例增加计算成本的前提下扩展神经网络(尤其是Transformer)的能力而日益受到关注。尽管如此,其在组成一般化(即适应已知组成的新组合)中的作用仍未得到充分探讨。本研究挑战了最小专家激活即可实现任务一般化的假设,考察了任务复杂性与SMoE模型最优稀疏性之间的关系。通过在SRAVEN符号推理任务和SKILL-MIX基准测试上的实证评估,我们证明:(i)激活的专家数量随任务难度的增加而稳定增加,以维持性能;(ii)最优激活专家数量与任务复杂性成比例。我们的理论分析推导出最优稀疏性的比例定律,通过平衡逼近误差与估计误差,揭示其与实证观察的一致性。我们正式证明,最优稀疏性位于最小激活(1-2个专家)与完全激活之间,其具体数值随任务复杂性成比例变化,并进一步受训练数据规模和模型复杂性的影响。这些发现为设计在实现计算效率的同时实现稳健组成一般化的SMoE模型提供了实用见解。

关键词

引用

@article{arxiv.2410.13964,
  title  = {Sparse Mixture-of-Experts for Compositional Generalization: Empirical Evidence and Theoretical Foundations of Optimal Sparsity},
  author = {Jinze Zhao and Peihao Wang and Junjie Yang and Ruisi Cai and Gaowen Liu and Jayanth Srinivasa and Ramana Rao Kompella and Yingbin Liang and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2410.13964},
  year   = {2025}
}

备注

23 pages