中文

检索增强的LoRA专家混合用于可上传机器学习

机器学习 2024-07-17 v2 人工智能

摘要

低秩适配(LoRA)为微调大型语言模型(LLM)提供了一种高效的方法。其模块化和即插即用的特性允许集成各种特定领域的LoRA,从而增强LLM的能力。像Huggingface和Modelscope这样的开源平台引入了一种新的计算范式——可上传机器学习(UML)。在UML中,贡献者使用去中心化的数据训练专门的适配器,然后将这些适配器上传到中央平台以改进LLM。该平台使用这些领域特定的适配器来处理需要个性化服务的混合任务请求。先前关于LoRA组合的研究要么专注于特定任务,要么在训练期间固定LoRA的选择。然而,在UML中,LoRA池会随着新上传而动态更新,这需要一个针对未见过的LoRA的通用选择机制。此外,下游请求的混合任务性质需要个性化服务。为了应对这些挑战,我们提出了检索增强的LoRA专家混合(RAMoLE),这是一个基于输入提示自适应地检索和组合多个LoRA的框架。RAMoLE包含三个主要组件:用于识别和检索相关LoRA的LoraRetriever、用于协调检索到的LoRA的即时MoLE机制,以及用于处理异构请求的高效批量推理。实验结果表明,RAMoLE始终优于基线,突显了其有效性和可扩展性。

关键词

引用

@article{arxiv.2406.16989,
  title  = {Retrieval-Augmented Mixture of LoRA Experts for Uploadable Machine Learning},
  author = {Ziyu Zhao and Leilei Gan and Guoyin Wang and Yuwei Hu and Tao Shen and Hongxia Yang and Kun Kuang and Fei Wu},
  journal= {arXiv preprint arXiv:2406.16989},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2402.09997