LoRA-Flow:生成任务中大语言模型的动态 LoRA 融合
计算与语言
2024-02-20 v1
摘要
LoRA 利用轻量级模块为每个下游任务或领域定制大语言模型(LLM),其中不同的学习附加模块代表不同的技能。组合现有的 LoRA 以解决新任务可以增强所学 LoRA 的可重用性,这对于标注数据有限的任务尤为有益。大多数关于 LoRA 组合的先前工作主要依赖于每个涉及 LoRA 的任务级权重,使得不同的示例和令牌共享相同的 LoRA 权重。然而,在生成任务中,不同的令牌可能需要不同的技能来管理。以中文数学任务为例,理解问题描述可能更依赖于中文 LoRA,而计算部分可能更依赖于数学 LoRA。为此,我们提出了 LoRA-Flow,它利用动态权重来调整不同 LoRA 的影响。每一步的权重由一个参数量极少的融合门决定,该门仅需 200 个训练样本即可学习。在六个生成任务上的实验表明,我们的方法始终优于具有任务级融合权重的基线方法。这强调了在 LoRA 组合中引入动态融合权重的必要性。
引用
@article{arxiv.2402.11455,
title = {LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks},
author = {Hanqing Wang and Bowen Ping and Shuo Wang and Xu Han and Yun Chen and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2402.11455},
year = {2024}
}
备注
Work in Progress