中文

MALoRA: 混合非对称低秩自适应用于增强多任务学习

计算与语言 2024-10-31 v1 机器学习

摘要

参数高效微调(PEFT)方法(如LoRA)显著改进了大语言模型(LLM)以资源高效的方式适应下游任务的能力。然而,在多任务场景中,训练不平衡和跷跷板效应等问题频繁出现。混合LoRA(MoLoRA)将LoRA与稀疏混合专家相结合,通过促进专家间的任务特定学习缓解了其中一些问题。尽管如此,MoLoRA在训练速度、参数利用率和整体多任务性能方面仍然效率低下。在本文中,我们提出了混合非对称低秩自适应(MALoRA),这是一个灵活的微调框架,它利用LoRA专家之间的非对称优化。MALoRA将可训练参数数量减少了30%至48%,将训练速度提高了1.2倍,并达到了与单任务LoRA模型相当的计算效率。此外,MALoRA解决了高秩配置中常见的过拟合问题,增强了性能稳定性。在多种多任务学习场景下的大量实验表明,MALoRA在域间和域内任务中均持续优于所有基线方法。

关键词

引用

@article{arxiv.2410.22782,
  title  = {MALoRA: Mixture of Asymmetric Low-Rank Adaptation for Enhanced Multi-Task Learning},
  author = {Xujia Wang and Haiyan Zhao and Shuo Wang and Hanqing Wang and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:2410.22782},
  year   = {2024}
}

备注

14 pages, 5 figures