中文

LLaMA-MoE:基于持续预训练构建 LLaMA 的混合专家模型

计算与语言 2024-06-25 v1

摘要

混合专家 (MoE) 近年来因作为扩大大语言模型 (LLM) 框架的前景而获得了日益关注的热度。然而,在大规模设置下从头训练 MoE 仍然面临数据需求高和不稳定的问题。为此,我们调查了如何从现有的稠密大语言模型构建 MoE 模型。具体而言,基于著名的 LLaMA-2 7B 模型,我们通过:(1) 专家构建 (Expert Construction),将原始前馈网络 (FFN) 的参数划分为多个专家;(2) 持续预训练 (Continual Pre-training),进一步训练转换后的 MoE 模型和额外的门控网络。本文全面探索了不同的专家构建方法以及各种数据抽样策略用于持续预训练。经过这些阶段,我们的 LLaMA-MoE 模型能够保持语言能力,并能将输入 token routing 到特定专家中,只激活部分参数。经验上,通过训练 200B token,LLaMA-MoE-3.5B 模型在包含类似激活参数的稠密模型中表现显著优于后者。源代码和模型可在 https://github.com/pjlab-sys4nlp/llama-moe 查阅。

关键词

引用

@article{arxiv.2406.16554,
  title  = {LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training},
  author = {Tong Zhu and Xiaoye Qu and Daize Dong and Jiacheng Ruan and Jingqi Tong and Conghui He and Yu Cheng},
  journal= {arXiv preprint arXiv:2406.16554},
  year   = {2024}
}