稠密训练,稀疏推理:重新思考混合专家语言模型的训练
机器学习
2024-04-09 v1 人工智能
计算与语言
摘要
与稠密模型相比,混合专家语言模型可以在不牺牲性能的情况下将计算成本降低 2-4 倍,使其在计算受限场景中更加高效。然而,MoE 模型通常需要 2-4 倍以上的参数才能达到与稠密模型相当的性能,这导致对 GPU 内存的需求更大,并使得 MoE 模型在自回归生成等 I/O 受限场景中效率降低。在这项工作中,我们为 MoE 模型提出了一种混合稠密训练和稀疏推理框架(DS-MoE),该框架通过在训练期间对所有专家采用稠密计算,并在推理期间采用稀疏计算,实现了强大的计算和参数效率。我们在训练 LLM 上的实验表明,我们的 DS-MoE 模型比标准稀疏 MoE 具有更高的参数效率,并且在总参数量和性能上与稠密模型相当,同时计算成本更低(仅激活模型参数的 30-40%)。使用 vLLM 进行的性能测试表明,我们的 DS-MoE-6B 模型运行速度比类似稠密模型(如 Mistral-7B)快达 ,比可比的 MoE 模型(如 DeepSeekMoE-16B 和 Qwen1.5-MoE-A2.7B)快 到 。
引用
@article{arxiv.2404.05567,
title = {Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models},
author = {Bowen Pan and Yikang Shen and Haokun Liu and Mayank Mishra and Gaoyuan Zhang and Aude Oliva and Colin Raffel and Rameswar Panda},
journal= {arXiv preprint arXiv:2404.05567},
year = {2024}
}