中文

Sparsity is Combinatorial Depth: 通过热心几何量化 MoE 的表达性

机器学习 2026-05-07 v2

摘要

虽然 Mixture-of-Experts (MoE) 架构定义了最新的性能,但其理论成功往往归因于启发式效率而非几何表达性。在本工作中,我们首次通过热心几何的视角分析 MoE,确立了 Top-kk 路由机制与 kk 次初等对称热心多项式的代数等同性。这种等同性将输入空间划分为超平面法向的一个 Normal Fan,从而揭示了\textbf{稀疏性是组合深度},该组合深度通过二项式系数 (Nk)\binom{N}{k} 扩大了几何容量。超出环境界限,我们引入了\textbf{有效容量} (Effective Capacity) 的概念,基于流形假设。我们证明,虽然稠密网络在低维数据上会因容量坍塌而下降,但 MoE 架构 exhibits \textit{组合韧性} (Combinatorial Resilience),通过路由锥的横截性维持高表达性。将这些理论界限转化为架构原则,我们推导了最优专家粒度的渐近容量限制,并证明共享专家是几何上必要的,以防止路由坍塌。

关键词

引用

@article{arxiv.2602.03204,
  title  = {Sparsity is Combinatorial Depth: Quantifying MoE Expressivity via Tropical Geometry},
  author = {Ye Su and Huayi Tang and Zixuan Gong and Yong Liu},
  journal= {arXiv preprint arXiv:2602.03204},
  year   = {2026}
}