DR-LoRA:面向混合专家模型微调的动态秩 LoRA
人工智能
2026-04-03 v5 计算与语言
摘要
混合专家模型已成为扩展大型语言模型 (LLMs) 的重要范式。诸如 LoRA 等参数高效微调方法被广泛采用,以将预训练 MoE LLMs 适配到下游任务。然而,现有方法通常为所有专家模块分配相同的 LoRA 秩,忽略了预训练专家的异构专业化。这种均匀分配导致资源不匹配:与任务相关的专家配置不足,而相关性较低的专家则获得冗余参数。为解决此问题,我们提出 DR-LoRA,一种用于微调预训练 MoE 模型的动态秩 LoRA 框架。具体而言,DR-LoRA 以较小的活跃秩初始化所有专家 LoRA 模块,并使用专家显著性得分(结合路由频率与基于梯度的秩重要性)来识别哪些专家将从额外容量中获益最多。然后,它周期性地扩展任务关键专家 LoRA 的活跃秩,逐步构建为目标任务量身定制的异构秩分布。在三个 MoE 模型和六个任务上的实验表明,DR-LoRA 始终优于 LoRA 和其他强基线,证明了任务自适应的异构秩分配是提高 MoE 微调中活跃容量利用率的有效策略。
引用
@article{arxiv.2601.04823,
title = {DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models},
author = {Guanzhi Deng and Bo Li and Ronghao Chen and Xiujin Liu and Zhuo Han and Huacan Wang and Lijie Wen and Linqi Song},
journal= {arXiv preprint arXiv:2601.04823},
year = {2026}
}