中文

变分推断、熵与正交性:混合专家模型的统一理论

机器学习 2026-01-08 v1

摘要

混合专家(MoE)模型使大型语言模型能够高效扩展,因为它们仅为每个输入激活一部分专家。然而,其核心机制——Top-k路由和辅助负载均衡——仍然是启发式的,缺乏支持它们的统一理论基础。为此,我们构建了第一个统一的理论框架,从贝叶斯视角严格推导出这些实践作为最优稀疏后验逼近和先验正则化,同时从信息论视角将其框架化为最小化路由歧义和最大化信道容量的机制。我们还指出了路由固有的组合困难性,将其定义为NP难的稀疏子集选择问题。我们严格证明了“相干性障碍”的存在;当专家表示表现出高互相干性时,贪心路由策略理论上无法恢复最优专家子集。重要的是,我们正式验证了在专家特征空间中施加几何正交性足以缩小NP难全局最优与多项式时间贪心逼近之间的差距。我们的比较分析证实,正交性正则化是大型模型的最优工程松弛。我们的工作为更深入理解MoE及其新颖设计提供了必要的理论支持和技术保障。

关键词

引用

@article{arxiv.2601.03577,
  title  = {Variational Inference, Entropy, and Orthogonality: A Unified Theory of Mixture-of-Experts},
  author = {Ye Su and Yong Liu},
  journal= {arXiv preprint arXiv:2601.03577},
  year   = {2026}
}

备注

27 pages, 3 figures