中文

DynMoLE:基于混合路由机制提升 LoRA 专家混合微调性能

计算与语言 2025-04-02 v1 人工智能

摘要

基于指令的大语言模型(LLM)微调在various自然语言处理(NLP)任务中取得了显著成功。参数高效微调(PEFT)方法,如混合 LoRA 专家(MoLE),将低秩适应(LoRA)的效率优势与混合专家(MoE)模型的通用性相结合,显示出处理多个下游任务的巨大潜力。然而,现有 MoLE 的路由机制常在计算效率与预测准确性之间存在权衡,且未能充分应对不同变换层中专家选择需求的多样性。本文提出 DynMoLE,一种基于路由器概率分布 Tsallis 熵动态调整专家选择的混合路由策略。该方法缓解了路由器不确定性,增强了稳定性,促进了更公平的专家参与,实现更快的收敛和更佳的模型性能。此外,我们引入基于 Tsallis 熵的辅助损失,以进一步引导模型在降低不确定性的同时收敛,从而提高训练稳定性和性能。我们在常识推理基准测试中进行了广泛实验,证明 DynMoLE 取得了显著的性能提升,超越 LoRA 9.6%,并超过最新 MoLE 方法 MoLA 2.3%。我们还对 DynMoLE 的关键组件进行了全面的消融研究,以评估其贡献。

关键词

引用

@article{arxiv.2504.00661,
  title  = {DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism},
  author = {Dengchun Li and Naizheng Wang and Zihao Zhang and Haoyang Yin and Lei Duan and Meng Xiao and Mingjie Tang},
  journal= {arXiv preprint arXiv:2504.00661},
  year   = {2025}
}

备注

22 pages, 7 figures