中文

联合 MoE 扩展律:专家混合模型可以内存高效

机器学习 2025-02-20 v2 人工智能 计算与语言

摘要

专家混合(Mixture of Experts, MoE)架构显著提高了大规模机器学习模型在研究和实际应用中的计算效率。然而,它们在内存约束下的可扩展性和效率仍然相对未被充分探索。在这项工作中,我们提出了稠密模型和 MoE 模型的联合扩展律,纳入了活跃参数数量、数据集大小和专家数量等关键因素。我们的发现为在固定内存和计算预算下选择最优 MoE 配置提供了一个原则性框架。令人惊讶的是,我们表明 MoE 模型可以比稠密模型更内存高效,这与传统观念相悖。为了推导和验证我们扩展律的理论预测,我们进行了超过 280 次实验,活跃参数高达 27 亿,总参数高达 50 亿。这些结果为在实际大规模训练场景中设计和部署 MoE 模型提供了可操作的见解。

关键词

引用

@article{arxiv.2502.05172,
  title  = {Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient},
  author = {Jan Ludziejewski and Maciej Pióro and Jakub Krajewski and Maciej Stefaniak and Michał Krutul and Jan Małaśnicki and Marek Cygan and Piotr Sankowski and Kamil Adamczewski and Piotr Miłoś and Sebastian Jaszczur},
  journal= {arXiv preprint arXiv:2502.05172},
  year   = {2025}
}