上调混合专家语言模型的比例定律
机器学习
2025-06-17 v2 计算与语言
摘要
预训练大型语言模型(LLM)资源密集,即使使用高端 GPU 集群,也需要数月的训练时间。两种缓解此计算需求的方法是:重用较小模型训练较大模型(上调),以及训练计算效率更高的混合专家(MoE)模型。本文研究将 LLM 上调为 MoE 模型的比例定律,此领域尚未充分探索。通过大量实验,我们识别出描述性能如何依赖数据规模和模型配置的经验比例定律。特别地,我们发现尽管扩大这些因素会提升性能,但稠密训练数据与上调训练数据的之间存在一种新型相互作用项,会限制在大计算预算下上调的效率。基于这些发现,我们提供比例上调的指导,并在预算约束下确立上调优于从头训练的条件。
引用
@article{arxiv.2502.03009,
title = {Scaling Laws for Upcycling Mixture-of-Experts Language Models},
author = {Seng Pei Liew and Takuya Kato and Sho Takase},
journal= {arXiv preprint arXiv:2502.03009},
year = {2025}
}
备注
ICML 2025. 16 figures, 8 tables. Code available at https://github.com/sbintuitions/sparse-upcycling-scaling-laws