中文

TT-LoRA MoE:统一参数高效微调与稀疏混合专家

机器学习 2026-01-27 v1 人工智能

摘要

我们提出Tensor-Trained Low-Rank Adaptation Mixture of Experts(TT-LoRA MoE),一种新的计算框架,将参数高效微调(PEFT)与稀疏MoE路由相结合,以解决大规模模型部署中的可扩展性挑战。不同于传统MoE方法面临随专家数量增长而产生的计算开销问题,TT-LoRA MoE将训练分解为两个独立优化的阶段。首先,我们独立训练轻量级张量化低秩适配器(TT-LoRA专家),每个专家针对特定任务进行专业化。随后,这些专家适配器保持冻结状态,消除多任务设置中的任务间干扰和灾难性遗忘。一个独立训练的稀疏MoE路由器动态利用基础模型表示为每个输入选择恰好一个专业化适配器,以推理时自动完成专家选择,无需显式任务指定。全面实验表明,我们的架构保持低秩适配器的内存效率,能够无缝扩展至大规模专家池,并实现稳健的任务级优化。这种结构化的解耦显著增强了计算效率和灵活性:仅使用LoRA的2%、Adapter的0.3%和AdapterFusion的0.03%参数,并在多任务场景下相较于AdapterFusion提升4个值,实现了实用且可扩展的多任务推理部署。

关键词

引用

@article{arxiv.2504.21190,
  title  = {TT-LoRA MoE: Unifying Parameter-Efficient Fine-Tuning and Sparse Mixture-of-Experts},
  author = {Pradip Kunwar and Minh N. Vu and Maanak Gupta and Mahmoud Abdelsalam and Manish Bhattarai},
  journal= {arXiv preprint arXiv:2504.21190},
  year   = {2026}
}