中文

预测就是MoE所需的一切:专家负载分布从波动走向稳定

机器学习 2024-04-29 v1 人工智能 计算与语言

摘要

MoE通过使模型的计算复杂度不再随参数增加而线性增长,促进了大型模型的发展。学习稀疏门控网络为每个要处理的令牌选择一组专家;然而,这可能导致在连续几次迭代中每个专家处理的令牌数量存在差异,即专家负载波动,从而降低了计算并行化和资源利用率。为此,在这项工作中,我们追踪并分析了几个大型语言模型在训练迭代中每个专家的负载,并定义了具有“明显负载波动”的瞬态和具有“时间局部性”的稳定状态。此外,考虑到这两种状态的特点和计算开销,我们部署了三种经典预测算法,实现了准确的专家负载预测结果。对于GPT3 350M模型,预测未来1000步和2000步专家负载比例的平均错误率分别约为1.3%和1.8%。这项工作可以为MoE模型训练的专家放置或资源分配提供有价值的指导。基于这项工作,我们将在未来的工作中提出一种针对瞬态和稳定状态的专家放置方案。

关键词

引用

@article{arxiv.2404.16914,
  title  = {Prediction Is All MoE Needs: Expert Load Distribution Goes from Fluctuating to Stabilizing},
  author = {Peizhuang Cong and Aomufei Yuan and Shimao Chen and Yuxuan Tian and Bowen Ye and Tong Yang},
  journal= {arXiv preprint arXiv:2404.16914},
  year   = {2024}
}