中文

PreMoE:高效混合专家模型的主动推理

机器学习 2026-04-27 v3

摘要

混合专家(Mixture-of-Experts,MoE)模型提供动态计算能力,但通常作为静态全容量模型部署,无法发挥部署特定化的潜力。我们引入PreMoE,一个无需训练的框架,用于为特定部署场景主动编译稀疏MoE变体。其核心是预测专家实用性(Predicted Expert Utility,PEU),这是一种从路由逻辑通过高置信度阈值过滤和逻辑转换来估计专家重要性的鲁棒指标,这两种技术共同稳定了在激进稀疏性下的实用性估计。在计算于小型校准集上的PEU得分基础上,PreMoE可用于生成面向特定领域的专家排名,从而用于编译特定领域的专家或高效的多域通用专家,无需任何重新训练。在参数规模从30B至718B的MoE模型上,PreMoE实现了最高达50%的稀疏度,几乎没有性能损失。它进一步暴露了一种实际的部署权衡:专家在领域内最大化效率,而合成通用专家在相同稀疏预算下保持更广泛的跨域能力。

关键词

引用

@article{arxiv.2505.17639,
  title  = {PreMoE: Proactive Inference for Efficient Mixture-of-Experts},
  author = {Zehua Pei and Ying Zhang and Hui-Ling Zhen and Tao Yuan and Xianzhi Yu and Zhenhua Dong and Sinno Jialin Pan and Mingxuan Yuan and Bei Yu},
  journal= {arXiv preprint arXiv:2505.17639},
  year   = {2026}
}