专家路由的三个阶段:混合专家训练中负载均衡的演变
机器学习
2026-04-07 v1 人工智能
多智能体系统
摘要
我们将混合专家(MoE)token路由建模为一种拥堵游戏,唯一有效参数为拥堵系数gamma_eff,用于量化平衡质量之间的权衡。在两套开源MoE模型的训练检查点(OLMoE-1B-7B(20个检查点,其中在突发区域进行密集采样)和OpenMoE-8B(6个检查点))上跟踪gamma_eff,揭示了三个阶段的轨迹:突发阶段(gamma_eff从14增至36-39,在3万-4万步区域达到高峰),稳定阶段(B_0从2.4减至2.3,步数10万-40万),放松阶段(gamma_eff从27减至9,步数40万-120万)。这种非单调轨迹对于后续分析已收敛模型的后验方法而言是不可见的,揭示了早期MoE训练优先考虑平衡,而晚期训练则优先考虑质量。该理论框架坦诚地说明了其局限性:单类型平衡等价于温度缩放的softmax(held-out L1: MFG = 0.199 vs. softmax = 0.200)。该游戏并非更好的预测器;它揭示了温度的意义,关键的是该温度是如何演变的。我们补充了有效的拥堵分解,即一种多类型扩展,通过对所有16层进行token聚类(平均30%)来改进负载预测(范围诊断K/M、epsilon_l),并通过四个独立质量估计器进行鲁棒性验证(r >= 0.89)。所有置信区间均来自对50个独立文本批次的bootstrap抽样。
引用
@article{arxiv.2604.04230,
title = {Three Phases of Expert Routing: How Load Balance Evolves During Mixture-of-Experts Training},
author = {Charafeddine Mouzouni},
journal= {arXiv preprint arXiv:2604.04230},
year = {2026}
}