中文

从稠密到混合专家的指令调优升级:参数合并方法

计算与语言 2024-10-04 v1 人工智能 机器学习

摘要

混合专家 (MoE) 在大型语言模型 (LLM) 中表现突出,在大量自然语言处理任务中展现出卓越性能。然而,现有将 LLM 从稠密转换为 MoE的方法面临着显著的数据要求,通常依赖大规模 post-training。在本文中,我们提出了 Upcycling Instruction Tuning (UpIT),一种数据高效的将稠密预训练模型调优为 MoE 指令模型的方法。具体而言,我们指出在稠密模型指令调优期间的中间检查点天然适合作为 specialized experts,然后提出了 expert expansion 阶段,通过基因算法和参数合并来灵活实现具有 flexible expert 数量的模型,确保新扩展 expert 的充分多样性。为确保 MoE 模型中的每个 specialized expert 如期发挥作用,我们选择少量每位 expert 都擅长的 seed 数据进行 pre-optimization。广泛的实验在各种数据规模和 upcycling 设置下表明,UpIT 在数据效率和卓越性能方面表现出色,以及在 expert 或 data scaling 中的稳定改进。进一步分析揭示了在 upcycling 中确保 expert 多样性的重要性。

关键词

引用

@article{arxiv.2410.01610,
  title  = {Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging},
  author = {Tingfeng Hui and Zhenyu Zhang and Shuohuan Wang and Yu Sun and Hua Wu and Sen Su},
  journal= {arXiv preprint arXiv:2410.01610},
  year   = {2024}
}

备注

work in progress