DLP-LoRA:面向大型语言模型的动态轻量化插件式LoRA融合
计算与语言
2025-02-19 v2 人工智能
机器学习
摘要
近期大型语言模型(LLM)的快速发展在各类任务上取得了卓越成绩,但为特定领域微调这些模型仍然代价高昂。低秩适应(LoRA)等参数高效微调(PEFT)方法通过微调少量参数来解决这一挑战。然而,现有方法缺乏基于上下文输入的动态融合,且因基于token级操作而增加推理时间。我们提出DLP-LoRA,一种动态轻量化插件,采用仅包含500万参数的mini-MLP模块,在句子层面通过top-p抽样策略动态融合多个LoRA。该方法通过并行计算将推理时间缩短至单LoRA推理时间的不到两倍。在覆盖26个任务(包括多选题和问答)的评估表明,DLP-LoRA在多选数据集上实现92.34%的平均准确率,在问答数据集上显著提升BLEU和ROUGE分数,超越不同LLM底层模型在组合任务设置下的表现。DLP-LoRA有效平衡了性能与效率,为LLM的动态多任务适应提供了实用解决方案。我们的代码已公开:https://github.com/MeCuping/DLP-LoRA。
引用
@article{arxiv.2410.01497,
title = {DLP-LoRA: Efficient Task-Specific LoRA Fusion with a Dynamic, Lightweight Plugin for Large Language Models},
author = {Yuxuan Zhang and Ruizhe Li},
journal= {arXiv preprint arXiv:2410.01497},
year = {2025}
}
备注
Preprint under review, 18 pages, 7 figures