Skywork-MoE:混合专家语言模型训练技巧深度解析
计算与语言
2024-06-12 v1 人工智能
摘要
本技术报告介绍了在 Skywork-MoE 开发中所实现的训练方法。Skywork-MoE 是一种高性能混合专家(MoE)大型语言模型(LLM),拥有 1460 亿参数和 16 个专家。它 initialized 于我们已有的 Skywork-13B 模型的稠密检查点。我们探讨了复刻 versus 从头初始化的比较有效性。我们的发现表明,这两种方法的选择应考虑现有稠密检查点的性能以及 MoE 训练预算。我们强调了两种创新技术:门控 logits 归一化提高了专家多样性,自适应辅助损失系数允许按层调整辅助损失系数。我们的实验结果验证了这些方法的有效性。利用这些技巧和见解,我们在我们精简的 SkyPile 语料库上训练了我们的 upcycled Skywork-MoE。评估结果显示,我们的模型在广泛的基准测试上提供了强大的性能。
引用
@article{arxiv.2406.06563,
title = {Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models},
author = {Tianwen Wei and Bo Zhu and Liang Zhao and Cheng Cheng and Biye Li and Weiwei Lü and Peng Cheng and Jianhao Zhang and Xiaoyu Zhang and Liang Zeng and Xiaokun Wang and Yutuan Ma and Rui Hu and Shuicheng Yan and Han Fang and Yahui Zhou},
journal= {arXiv preprint arXiv:2406.06563},
year = {2024}
}