将混合专家推向极限:面向指令微调的极高参数效率 MoE
计算与语言
2023-09-12 v1 机器学习
摘要
混合专家(Mixture of Experts, MoE)是一种广为人知的神经架构,其中一组专门化子模型以恒定计算成本优化整体性能。然而,传统 MoE 因需将所有专家存入内存而在规模化时带来挑战。在本文中,我们将 MoE 推向极限。我们通过独特地将 MoE 架构与轻量专家相结合,提出了极高参数效率的 MoE。我们的 MoE 架构仅更新轻量专家——少于一个 110 亿(11B)参数模型的 1%——便优于标准参数高效微调(PEFT)方法,并与全量微调表现相当。此外,我们的方法可泛化至未见任务,因其不依赖任何先验任务知识。我们的研究凸显了混合专家架构的通用性,展示了即使在严苛参数约束下也能提供稳健性能的能力。我们所有实验中使用的代码公开于:https://github.com/for-ai/parameter-efficient-moe。
引用
@article{arxiv.2309.05444,
title = {Pushing Mixture of Experts to the Limit: Extremely Parameter Efficient MoE for Instruction Tuning},
author = {Ted Zadouri and Ahmet Üstün and Arash Ahmadian and Beyza Ermiş and Acyr Locatelli and Sara Hooker},
journal= {arXiv preprint arXiv:2309.05444},
year = {2023}
}