Sparsity is Combinatorial Depth: 通过热心几何量化 MoE 的表达性
机器学习
2026-05-07 v2
摘要
虽然 Mixture-of-Experts (MoE) 架构定义了最新的性能,但其理论成功往往归因于启发式效率而非几何表达性。在本工作中,我们首次通过热心几何的视角分析 MoE,确立了 Top- 路由机制与 次初等对称热心多项式的代数等同性。这种等同性将输入空间划分为超平面法向的一个 Normal Fan,从而揭示了\textbf{稀疏性是组合深度},该组合深度通过二项式系数 扩大了几何容量。超出环境界限,我们引入了\textbf{有效容量} (Effective Capacity) 的概念,基于流形假设。我们证明,虽然稠密网络在低维数据上会因容量坍塌而下降,但 MoE 架构 exhibits \textit{组合韧性} (Combinatorial Resilience),通过路由锥的横截性维持高表达性。将这些理论界限转化为架构原则,我们推导了最优专家粒度的渐近容量限制,并证明共享专家是几何上必要的,以防止路由坍塌。
关键词
引用
@article{arxiv.2602.03204,
title = {Sparsity is Combinatorial Depth: Quantifying MoE Expressivity via Tropical Geometry},
author = {Ye Su and Huayi Tang and Zixuan Gong and Yong Liu},
journal= {arXiv preprint arXiv:2602.03204},
year = {2026}
}