中文

高层需要更多 LoRA 专家

计算与语言 2024-02-14 v1 人工智能

摘要

诸如低秩自适应等参数高效微调技术为大型语言模型提供了训练效率,但其对模型性能的提升仍然有限。近期的工作将 LoRA 与混合专家集成,以提升 PEFT 方法的性能。尽管结果令人期待,但关于利用 MoE 提升 LoRA 效率的研究仍处于早期阶段。近期研究表明,MoE 架构中的专家具有不同的优势,且表现出一定的冗余。这一结论是否同样适用于参数高效的 MoE?在本文中,我们提出了一种新颖的参数高效 MoE 方法——面向基于 Transformer 模型的分层专家分配 MoE-LORA(MoLA),其中每一模型层均可灵活使用不同数量的 LoRA 专家。我们研究了多种具有不同分层专家配置的架构。在六个著名的自然语言处理与常识问答基准上的实验表明,MoLA 取得了与所有基线相当或更优的性能。我们发现,在专家总数一定的情况下,为高层分配更多的 LoRA 专家可进一步提升模型的有效性。在参数量大幅减少的情况下,该分配策略优于在每层配置相同数量专家的设置。本工作可作为一种即插即用的参数高效微调方法,广泛应用于各类应用中。代码可在 https://github.com/GCYZSL/MoLA 获取。

关键词

引用

@article{arxiv.2402.08562,
  title  = {Higher Layers Need More LoRA Experts},
  author = {Chongyang Gao and Kezhen Chen and Jinmeng Rao and Baochen Sun and Ruibo Liu and Daiyi Peng and Yawen Zhang and Xiaoyuan Guo and Jie Yang and VS Subrahmanian},
  journal= {arXiv preprint arXiv:2402.08562},
  year   = {2024}
}

备注

The code is available at https://github.com/GCYZSL/MoLA