跨模型架构的缩放定律:大型语言模型中密集模型与MoE模型的比较分析
机器学习
2024-10-10 v1 人工智能
摘要
大型语言模型(LLM)的缩放是模型训练和部署效率与有效性的关键研究领域。我们的工作研究了密集模型和混合专家(MoE)模型之间缩放定律的可迁移性和差异。通过结合理论分析和大量实验,包括一致的损失缩放、最优批次大小和学习率缩放以及资源分配策略缩放,我们的研究结果表明幂律缩放框架同样适用于MoE模型,这表明即使架构不同,控制这些模型缩放行为的基本原理仍然保持不变。此外,MoE模型展现出优越的泛化能力,在相同的训练计算预算下,其测试损失低于密集模型。这些发现表明了MoE模型的缩放一致性和迁移泛化能力,为优化MoE模型的训练和部署策略提供了新的见解。
引用
@article{arxiv.2410.05661,
title = {Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models},
author = {Siqi Wang and Zhengyu Chen and Bei Li and Keqing He and Min Zhang and Jingang Wang},
journal= {arXiv preprint arXiv:2410.05661},
year = {2024}
}