中文

通用专家混合:通过深度-宽度转换扩展虚拟宽度

机器学习 2026-03-06 v1 人工智能 计算与语言

摘要

混合专家(MoE)将模型容量与单token计算量解耦,但其可扩展性仍受制于深度和宽度的物理维度。为突破这一限制,我们提出了通用专家混合(MOUE),这是一种MoE的推广,引入了新的扩展维度:虚拟宽度。总体而言,MOUE旨在通过在各层之间共享一个通用层无关专家池,将深度转换为虚拟宽度,在固定的单token激活预算下实现此转换。然而,仍存在两个挑战:来自递归专家重复使用的路由路径爆炸,以及重复导致的暴露与常规负载平衡目标之间的不匹配。我们通过三个核心组件来解决这些问题:用于结构化专家共享的错位旋转拓扑、用于深度感知暴露校正的通用专家负载平衡,以及具备轻量级轨迹状态的通用路由器,以实现连贯的多步骤路由。实验方面,MOUE在各种扩展规模下均一致优于匹配的MoE基线,最高可提升1.3%;并且能够通过渐进方式转换现有MoE检查点,最高可实现4.2%的提升,揭示了MoE架构的新扩展维度。

关键词

引用

@article{arxiv.2603.04971,
  title  = {Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation},
  author = {Yilong Chen and Naibin Gu and Junyuan Shang and Zhenyu Zhang and Yuchen Feng and Jiawei Sheng and Tingwen Liu and Shuohuan Wang and Yu Sun and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2603.04971},
  year   = {2026}
}

备注

19 pages, 10 figures