中文

迈向推理最优的混合专家大语言模型

机器学习 2024-04-04 v1

摘要

基于混合专家的大型语言模型,如最近的 Mixtral 和 DeepSeek-MoE,在扩展模型规模方面展现出了巨大潜力,且无需承受稠密 Transformer 训练成本的二次增长。与稠密模型一样,训练 MoE 需要回答同样的问题:在给定的训练预算下,模型大小和 token 数量的最优分配是什么?我们研究了基于 MoE 的 LLM 关于模型性能、模型大小、数据集大小和专家度之间关系的缩放律。与先前在不同背景下研究 MoE 的研究相呼应,我们观察到增加专家数量存在边际效益递减,但这似乎暗示我们应该将专家数量扩展至饱和,因为训练成本将保持不变,而这在推理期间是有问题的。我们提议通过引入推理效率作为验证损失之外的另一指标来修正 MoE 的缩放律。我们发现,在相同性能下,具有少量(4/8)专家的 MoE 是最高效的部署方案,但其训练成本高出 2.5-3.5 倍。另一方面,在训练预算下,训练一个比损失最优方案小得多(70-85%)的(16/32)专家 MoE 并使用更大的训练数据集是一种有前景的设置。

关键词

引用

@article{arxiv.2404.02852,
  title  = {Toward Inference-optimal Mixture-of-Expert Large Language Models},
  author = {Longfei Yun and Yonghao Zhuang and Yao Fu and Eric P Xing and Hao Zhang},
  journal= {arXiv preprint arXiv:2404.02852},
  year   = {2024}
}

备注

15 pages, 8 figures