专家路由何时会被误导?混合专家语言模型中的反事实路由分析
机器学习
2026-05-11 v1 计算与语言
摘要
混合专家(MoE)语言模型会将每个 token路由到一小部分专家,但对训练后的top-路由器所选路由是否为良好路由几乎没有直接评估。本文固定模型,比较每个标准路由与对相同token抽样的等计算替代方案,并通过在验证推理轨迹中所得token的得分来评估每个路由。结果呈现出严格的token条件性:在确信的token上,标准路由器与路由效用高度一致,但在驱动复杂推理的脆弱token上,标准路由器几乎无信息,lower-loss的等计算路由始终存在于冻结模型中但未被选中。该模式在Qwen3-30B-A3B、GPT-OSS-20B、DeepSeek-V2-Lite和OLMoE-1B-7B上均成立,并从标准top-训练如何评估路由决策的结构中得出:语言建模损失仅对执行的路由计分,负载平衡仅依赖于聚合路由统计。对最终层路由器进行最小化的仅路由更新(其他专家和其他路由器全部冻结),即可在AIME 2024+2025和HMMT 2025的pass@K上取得提升,表明至少部分失败源于路由可达的误分配,而非专家容量。
引用
@article{arxiv.2605.07260,
title = {When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models},
author = {Youngsik Yoon and Siwei Wang and Wei Chen and Jungseul Ok},
journal= {arXiv preprint arXiv:2605.07260},
year = {2026}
}