中文

HELLoRA:面向混合专家模型的热专家层级低秩适配

机器学习 2026-05-20 v1 人工智能

摘要

低秩适配(LoRA)主导着大型语言模型的参数高效微调,但大多数变体针对密集架构。混合专家模型以近乎恒定的每 token 计算量扩展参数,其稀疏激活模式为更高效的适配创造了未开发的机遇。我们提出热专家层级低秩适配(HELLoRA),仅在每层最频繁激活的专家上附加 LoRA 模块。这一简单机制减少了可训练参数和适配器引入的 FLOPs,同时提升了下游性能,我们将此效应归因于一种保留预训练专家专业化的结构化正则化。为在极端参数预算下压力测试 HELLoRA,我们进一步将其与 LoRI 组合形成 HELLoRI,冻结上投影并稀疏化下投影。在三个 MoE 主干(即 OlMoE-1B-7B、Mixtral-8x7B 和 DeepSeekMoE)以及涵盖数学推理、代码生成和安全对齐的三个任务族上,HELLoRA 始终优于强 PEFT 基线。相对于 OlMoE 上的普通 LoRA,HELLoRA 使用 15.7% 的可训练参数,将适配器 FLOPs 减少 38.7%,训练吞吐量达 1.9 倍,准确率提升 9.2%。在 DeepSeekMoE 上,HELLoRA 仅使用 23.2% 的可训练参数便优于 LoRA。这些结果表明,激活感知的适配器放置是扩展 MoE 语言模型 PEFT 的有效且实用的途径。

关键词

引用

@article{arxiv.2605.18795,
  title  = {HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models},
  author = {Jia Wei and Zhonghao Zhang and Ping Chen and Qianyang li and Yancheng Pan and Shaoxun Wang and Ziyi Qiu and Longxiang Wang},
  journal= {arXiv preprint arXiv:2605.18795},
  year   = {2026}
}