中文

每个秩都可以是专家:单秩混合专家LoRA用于多任务学习

机器学习 2025-06-23 v2 人工智能

摘要

低秩适应(LoRA)因其高效性和模块化特性而广泛用于将大型语言模型(LLM)适配到特定领域。然而,vanilla LoRA在多任务场景中难以处理任务间的冲突。近期研究通过将每个LoRA模块视为专家,采用混合专家(MoE)方法,以通过多个专门化的LoRA模块缓解任务间干扰。虽然有效,但这些方法常使知识局限于单个任务,无法充分发挥跨相关任务间共享知识的潜力。本文建立了单一LoRA与多LoRA MoE之间的联系,将其整合到统一框架中。我们表明,多个LoRAs的动态路由在功能上等价于单一LoRA中的秩分区和块级激活。我们进一步通过实证研究表明,在相同的总激活参数约束下,更细粒度的LoRA分区可为异构任务带来更好的性能提升。基于上述发现,我们提出单秩混合专家LoRA(SMoRA),通过将每个秩视为独立专家来将MoE嵌入LoRA。SMoRA采用动态秩级激活机制,促进更细粒度的知识共享,同时缓解任务间冲突。实验表明,SMoRA在多任务场景下激活更少参数,却能实现更佳性能。

关键词

引用

@article{arxiv.2501.15103,
  title  = {Each Rank Could be an Expert: Single-Ranked Mixture of Experts LoRA for Multi-Task Learning},
  author = {Ziyu Zhao and Yixiao Zhou and Zhi Zhang and Didi Zhu and Tao Shen and Zexi Li and Jinluan Yang and Xuwu Wang and Jing Su and Kun Kuang and Zhongyu Wei and Fei Wu and Yu Cheng},
  journal= {arXiv preprint arXiv:2501.15103},
  year   = {2025}
}