中文

FlyLoRA:通过隐式秩级混合专家提升任务解耦与参数效率

机器学习 2025-10-24 v2 人工智能 计算与语言

摘要

低秩适应(LoRA)是基础模型中广泛使用的参数高效微调方法,但其存在参数干扰,导致性能次优。虽然基于混合专家(MoE)的LoRA变体在缓解单任务指令调优中任务内部相关性方面显示出前景,但它们引入额外的路由参数,在多任务模型合并中仍然无效,因为存在任务间干扰。灵感来自飞行嗅觉回路,我们提出FlyLoRA,这是一种基于隐式MoE的LoRA变体,引入:(1)在上投影矩阵中的秩级专家激活,和(2)一个隐式路由器,统一专家路由和下投影,其中冻结的稀疏随机投影矩阵取代传统的稠密可训练版本。该设计通过消除显式路由器的需求,解决了任务内部解耦与计算效率之间的权衡,同时由于随机矩阵的正交性质,天然缓解了任务间干扰。跨越四个领域——通用知识理解、科学问答、数学推理和代码生成——的大量实验表明,FlyLoRA在现有方法上 consistently 取得性能提升。除经验性收益外,FlyLoRA凸显了生物学结构如何激发AI技术创新的潜力。代码已公开于 https://github.com/gfyddha/FlyLoRA。

关键词

引用

@article{arxiv.2510.08396,
  title  = {FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts},
  author = {Heming Zou and Yunliang Zang and Wutong Xu and Yao Zhu and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2510.08396},
  year   = {2025}
}

备注

NeurIPS 2025 accepted paper