中文

混合专家遇见指令微调:大语言模型的双赢组合

计算与语言 2023-07-06 v2

摘要

稀疏混合专家(MoE)是一种神经架构设计,可用于在不增加推理成本的前提下为大语言模型(LLMs)添加可学习参数。指令微调是一种训练LLMs遵循指令的技术。我们主张将这两种方法结合,因为我们发现MoE模型比稠密模型更能从指令微调中获益。具体而言,我们在三种实验设置下进行了实证研究:(i)在缺乏指令微调的个体下游任务上直接微调;(ii)指令微调后在下游任务上进行上下文少样本或零样本泛化;以及(iii)指令微调辅以在个体下游任务上进一步微调。在第一种情境中,MoE模型总体表现不及计算容量相同的稠密模型。然而,随着指令微调(第二与第三种情境)的引入——无论单独使用还是与任务特定微调结合——这一情况发生了显著改变。我们最强大的模型FLAN-MOE-32B在四项基准任务上超越了FLAN-PALM-62B的性能,同时仅使用了其三分之一的FLOPs。FLAN-MOE所体现的进步启发了在任务无关学习框架下对大规模高性能语言模型设计原则的重新评估。

关键词

引用

@article{arxiv.2305.14705,
  title  = {Mixture-of-Experts Meets Instruction Tuning:A Winning Combination for Large Language Models},
  author = {Sheng Shen and Le Hou and Yanqi Zhou and Nan Du and Shayne Longpre and Jason Wei and Hyung Won Chung and Barret Zoph and William Fedus and Xinyun Chen and Tu Vu and Yuexin Wu and Wuyang Chen and Albert Webson and Yunxuan Li and Vincent Zhao and Hongkun Yu and Kurt Keutzer and Trevor Darrell and Denny Zhou},
  journal= {arXiv preprint arXiv:2305.14705},
  year   = {2023}
}

备注

Preprint