中文

Symphony-MoE:将异构预训练模型协调为一致的混合专家模型

机器学习 2025-11-13 v2 人工智能

摘要

混合专家模型通过稀疏激活大型参数集,最小化计算开销,从而实现了可扩展的性能。为了缓解从头训练 MoE 的高昂成本,近期的工作采用升级回收技术,通过复制单个预训练稠密模型的前馈网络(FFN)层来构建专家。然而,这限制了专家的多样性,因为所有专家均源自单个预训练稠密模型。本文通过使用来自多个架构相同但异构的预训练模型(如 Qwen2.5-Coder 和 Qwen2)的专家来构建强大的 MoE 模型,从而解决了这一局限性。一个关键挑战在于,这些源模型占据了参数空间中不同且不和谐的区域,使得直接升级回收容易导致严重的性能退化。为克服这一问题,我们提出了 Symphony-MoE,一种旨在将这些模型协调为单一、一致的专家混合的新型两阶段框架。首先,我们以无需训练的方式建立这种协调:通过层级感知融合策略构建共享骨干网络,并关键性地利用基于激活的功能对齐来缓解专家间的参数错位。随后,一个后训练阶段协调整个架构。实验表明,我们的方法成功集成了来自异构源的专家,实现了一个在多领域任务和分布外泛化上显著超越基线的 MoE 模型。

关键词

引用

@article{arxiv.2509.18542,
  title  = {Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts},
  author = {Qi Wang and Hanyang Peng and Yue Yu},
  journal= {arXiv preprint arXiv:2509.18542},
  year   = {2025}
}