中文

Ban&Pick:通过更智能的路由提升 MoE-LLM 的性能与效率

机器学习 2025-10-01 v2 人工智能

摘要

稀疏混合专家 (MoE) 已成为高效扩展大语言模型 (LLM) 的关键架构。最近的细粒度 MoE 设计引入数百个专家每层,并激活每个标记多个专家,从而实现更强的专业化。然而,在预训练期间,路由器主要为稳定性和鲁棒性优化:它们会提前收敛并强制均衡使用,从而限制了模型性能和推理效率的完全潜力。在本 work 中,我们发现了两个被忽视的问题:(i) 少数高度有影响力的专家因过早且均衡的路由决策而被低估利用;(ii) 对每个标记强制激活固定数量的专家引入了显著的冗余。不通过重新训练模型或重新设计 MoE 架构,我们引入 Ban&Pick,一种用于更智能路由的后训练、即插即用策略。Pick 发现并强化关键专家——一小组对性能有杠杆作用的专家——leading to notable accuracy gains across domains。Ban 进一步基于层和标记灵敏度动态剔除冗余专家,实现更快的推理速度,同时保持最小的精度损失。在 DeepSeek、Qwen3 等细粒度 MoE-LLM 上进行的实验表明,Ban\&Pick 在数学、代码和一般推理基准测试中均能实现性能提升和推理加速,无需重新训练或架构更改。例如,在 Qwen3-30B-A3B 上,AIME2024 的准确率从 80.67 提升至 84.66,GPQA-Diamond 从 65.66 提升至 68.18,在 vLLM 下推理加速 1.25 倍。

关键词

引用

@article{arxiv.2509.06346,
  title  = {Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing},
  author = {Yuanteng Chen and Peisong Wang and Yuantian Shao and Nanxin Zeng and Chang Xu and Jian Cheng},
  journal= {arXiv preprint arXiv:2509.06346},
  year   = {2025}
}

备注

21 pages, 9 figures