中文

LoRA 专家混合

计算与语言 2024-04-23 v1 机器学习 多媒体

摘要

LoRA 在大预训练模型的微调中广受欢迎,可满足多样化的下游任务需求,展现出显著的有效性和效率,从而确立了其作为最流行微调技术之一的地位。由于 LoRA 的模块化插拔特性,研究人员致力于合并多个 LoRA 以使模型在各种下游任务中大放异彩。然而,现有的 LoRA 融合方法面临挑战。直接算术合并可能导致原始预训练模型的生成能力丧失或 LoRA 的独特身份被削弱,从而产生次优结果。另一方面,基于参考调谋的融合在灵活性方面存在局限,难以有效组合多个 LoRA。为此,本文提出 Mixture of LoRA Experts(MoLE)方法,利用层次控制和无限制的分支选择。MoLE 方法不仅在与直接算术合并相比下实现了卓越的 LoRA 融合性能,还保留了有效组合 LoRA 的关键灵活性。在自然语言处理(NLP)和视觉与语言(V&L)领域进行的大量实验评估均证实了 MoLE 的有效性。

关键词

引用

@article{arxiv.2404.13628,
  title  = {Mixture of LoRA Experts},
  author = {Xun Wu and Shaohan Huang and Furu Wei},
  journal= {arXiv preprint arXiv:2404.13628},
  year   = {2024}
}

备注

17 pages, 11 figures