中文

DeRS:面向极致效率的可回收混合专家模型

机器学习 2025-03-04 v1

摘要

可回收混合专家(MoE)模型在various任务中显示出巨大的潜力,通过将预训练稠密模型中的原始前馈网络(FFN)层转换为MoE层。然而,这些模型仍因引入多个专家而受限于显著的参数效率。本文提出一种新型DeRS(分解、替换、综合)范式来克服这一短coming,基于我们对可回收MoE专家唯一性冗余机制的观察。具体而言,DeRS将专家分解为一个专家共享的基线权重和多个专家特定的delta权重,并进一步以轻量级形式表示这些delta权重。我们提出的DeRS范式可应用于两种不同场景以提升参数效率:1)DeRS压缩用于推理阶段,通过稀疏化或量化压缩原始可回收MoE模型;2)DeRS回收用于训练阶段,采用轻量级稀疏或低秩矩阵高效地将稠密模型回recycle为MoE模型。广泛的实验表明,所提方法在保持可训练性和压缩的性能方面实现了极致的参数效率。

关键词

引用

@article{arxiv.2503.01359,
  title  = {DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts Models},
  author = {Yongqi Huang and Peng Ye and Chenyu Huang and Jianjian Cao and Lin Zhang and Baopu Li and Gang Yu and Tao Chen},
  journal= {arXiv preprint arXiv:2503.01359},
  year   = {2025}
}

备注

Accepted by CVPR2025