中文

DIVE into MoE:从密集到混合专家的多样性增强重建大语言模型

计算与语言 2025-06-12 v1

摘要

采用混合专家(Mixture-of-Experts, MoE)架构的大语言模型(LLMs)通过选择性激活部分参数实现了高成本效率。尽管 MoE LLMs 在推理效率方面具有优势,但从头训练大量专家会带来沉重的开销,而将密集 LLM 重建为 MoE LLM 则显著降低了训练预算。然而,现有重建方法往往忽视了专家之间的多样性,导致潜在的冗余。在本文中,我们观察到一个特定的 LLM 在不同校准数据集上进行剪枝后表现出显著的多样性,基于此我们提出了一种多样性增强的重建方法 DIVE。DIVE 的流程包括领域亲和性挖掘、基于剪枝的专家重建和高效微调。具体而言,重建包括对前馈网络(FFN)模块的剪枝与重组。重建后,我们对路由器、专家和归一化模块进行高效微调。我们在 Llama 风格 LLMs 和开源训练语料上实现了 DIVE。实验表明,DIVE 在训练效率方面表现出色,在相同激活参数数量下实现了最小的精度权衡,优于现有的剪枝和 MoE 重建方法。

关键词

引用

@article{arxiv.2506.09351,
  title  = {DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts},
  author = {Yuchen Feng and Bowen Shen and Naibin Gu and Jiaxuan Zhao and Peng Fu and Zheng Lin and Weiping Wang},
  journal= {arXiv preprint arXiv:2506.09351},
  year   = {2025}
}

备注

ACL 2025