GatePro:面向混合专家模型的参数-free 专家选择优化
计算与语言
2025-10-16 v1 机器学习
摘要
现代大型语言模型利用混合专家(Mixture-of-Experts,MoE)架构实现高效扩缩,但面临一个关键挑战:功能相似的专家常被同时选中,导致冗余计算并限制有效模型容量。现有辅助平衡损失方法改善了 token 分配,却未能解决专家多样性问题的本质。我们引入 GatePro,一种新型参数-free 方法,直接促进专家选择的多样性。GatePro 识别最相似的专家对,引入局部竞争机制,防止冗余专家共激活,同时保持专家的自然专化。我们的全面评估表明,GatePro 在不同模型规模和基准测试中均有效。分析表明,GatePro 能够实现更高的专家多样性,即专家发展出更独特且互补的能力,避免功能冗余。该方法可在任何训练阶段以热插拔方式部署,无需额外可学习参数,为改善 MoE 有效性提供了实用解决方案。
引用
@article{arxiv.2510.13079,
title = {GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models},
author = {Chen Zheng and Yuhang Cai and Deyi Liu and Jin Ma and Yiyuan Ma and Yuan Yang and Jing Liu and Yutao Zeng and Xun Zhou and Siyuan Qiao},
journal= {arXiv preprint arXiv:2510.13079},
year = {2025}
}