参数高效稀疏构建:从稠密模型到混合专家模型用于通用任务的指令微调
人工智能
2024-09-25 v4
摘要
大型语言模型在通用自然语言处理任务中展现了相当高的熟练度。指令微调是一种成功的范式,增强了大型语言模型遵循自然语言指令的能力,并在通用任务中表现出强大的泛化能力。然而,由于模型容量受限,这些模型在多个任务上常常遇到性能限制。在指令微调阶段扩展这种容量带来了重大挑战。为了解决这个问题,我们引入了参数高效稀疏构建(PESC),该方法使用混合专家(MoE)架构将稠密模型构建为稀疏模型。PESC将适配器集成到稀疏模型的MoE层中,在不改变这些层内各个权重的情况下区分专家。与原始稀疏升级相比,该方法在保证函数空间逼近质量的前提下,通过最小化参数增加显著降低了计算成本和GPU内存需求,从而促进了模型容量的扩展。我们的实证评估证明了PESC方法的有效性。在指令微调中使用PESC,我们最好的稀疏模型优于其他稀疏和稠密模型,并且展现出比GPT-3.5更优越的通用能力。我们的代码可在 https://github.com/wuhy68/Parameter-Efficient-MoE 获取。
引用
@article{arxiv.2401.02731,
title = {Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks},
author = {Haoyuan Wu and Haisheng Zheng and Zhuolun He and Bei Yu},
journal= {arXiv preprint arXiv:2401.02731},
year = {2024}
}