Nexus:高效训练混合专家模型的专精与适应性结合
计算与语言
2024-08-29 v1 人工智能
机器学习
摘要
效率、专精性和对新数据分布的适应性是当前大型语言模型难以兼顾的特性。混合专家(MoE)架构因其内在的条件计算能力而成为重要研究焦点,因为这种能力能够实现上述理想属性。本文聚焦于将稠密专家模型“改造”为MoE,以提升专精性并添加对新任务的适应性。我们引入Nexus,一种具有自适应路由的增强型MoE架构,模型学习将专家嵌入从领域表示中投影。这一方法允许Nexus在初始改造后,通过独立训练的稠密模型灵活添加新的专家,而无需对未知数据领域进行大规模MoE训练。我们的实验表明,Nexus在初始改造方面相对于基线实现了最高可达2.1%的相对提升,而通过有限微调数据扩展专家时实现了18.8%的相对提升。这一灵活性对于构建开源生态系统至关重要,使得每个用户都能根据自身需求持续组装自己的MoE混合模型。
引用
@article{arxiv.2408.15901,
title = {Nexus: Specialization meets Adaptability for Efficiently Training Mixture of Experts},
author = {Nikolas Gritsch and Qizhen Zhang and Acyr Locatelli and Sara Hooker and Ahmet Üstün},
journal= {arXiv preprint arXiv:2408.15901},
year = {2024}
}