中文

MiLoRA:用于大语言模型微调的高效混合低秩适应

计算与语言 2024-10-24 v1

摘要

低秩适应(LoRA)及其混合专家(MOE)变体是高效的参数高效微调(PEFT)方法。然而,由于在Transformer层的多个线性模块中添加了LoRA模块和MOE路由器,它们在多租户场景中引入了显著的延迟。为了解决这个问题,我们提出了混合低秩适应(MiLoRA),一种新颖且高效的LoRA变体。MiLoRA与之前的MOE风格LoRA方法不同,它将每个LoRA模块视为一个专家,并采用一种提示感知的路由机制。该机制在生成第一个新词元之前计算一次专家路由结果,并为后续词元重用这些结果,从而减少延迟。在常识推理任务、数学推理任务以及广泛使用的LLM评估基准上的大量实验和分析表明,MiLoRA在可调参数预算相当的情况下,始终优于强大的PEFT基线。此外,与之前基于LoRA的方法相比,MiLoRA在多租户场景中显著降低了延迟。

关键词

引用

@article{arxiv.2410.18035,
  title  = {MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuning},
  author = {Jingfan Zhang and Yi Zhao and Dan Chen and Xing Tian and Huanran Zheng and Wei Zhu},
  journal= {arXiv preprint arXiv:2410.18035},
  year   = {2024}
}

备注

Accepted by EMNLP 2024 Findings. arXiv admin note: substantial text overlap with arXiv:2405.18203