中文

细粒度混合专家模型的缩放定律

机器学习 2024-02-13 v1 人工智能 计算与语言

摘要

混合专家(MoE)模型已成为降低大语言模型计算成本的主要解决方案。在本文中,我们分析了它们的缩放特性,并引入了更广泛的变量范围。具体而言,我们引入了一个新的超参数——粒度(granularity),对其调整可以精确控制专家的大小。在此基础上,我们建立了细粒度 MoE 的缩放定律,考虑了训练 token 数量、模型大小和粒度。利用这些定律,我们推导出了给定计算预算下的最优训练配置。我们的发现不仅表明 MoE 模型始终优于稠密 Transformer,还强调了随着模型规模和训练预算的增加,稠密模型与 MoE 模型之间的效率差距正在扩大。此外,我们证明了将 MoE 中专家的大小设置为镜像前馈层的常见做法,在几乎任何计算预算下都不是最优的。

关键词

引用

@article{arxiv.2402.07871,
  title  = {Scaling Laws for Fine-Grained Mixture of Experts},
  author = {Jakub Krajewski and Jan Ludziejewski and Kamil Adamczewski and Maciej Pióro and Michał Krutul and Szymon Antoniak and Kamil Ciebiera and Krystian Król and Tomasz Odrzygóźdź and Piotr Sankowski and Marek Cygan and Sebastian Jaszczur},
  journal= {arXiv preprint arXiv:2402.07871},
  year   = {2024}
}