时间扩展的混合专家模型
机器学习
2026-04-23 v1
摘要
混合专家模型目前在固定推理速度下扩展模型容量方面很受欢迎,它几乎在每个词元处都会切换专家。一旦模型大小超出可用的GPU内存,这种频繁切换会使卸载和预取等优化失效。我们论证了强化学习中的选项框架是解决此问题的完美匹配,并主张采用时间扩展的混合专家层。基于带有决策代价的选项-评论家框架,我们为每一层添加了一个控制器,用于学习何时切换专家集以及加载哪些专家。通过将此方法应用于带有低秩适配器和自蒸馏奖励的gpt-oss-20b模型,我们的方法将切换率从超过50%降低到5%以下,同时在MATH、MMLU和MMMLU基准上保留了高达90%的基础模型准确率。这表明,即使是现有的预训练模型也可以通过轻量级训练转换为时间扩展的MoE,而惩罚代价允许模型训练者在切换率和能力之间进行权衡。我们希望这能为日益庞大的MoE模型的内存高效服务与持续学习开辟一条基于选项框架的原则性路径。
引用
@article{arxiv.2604.20156,
title = {Temporally Extended Mixture-of-Experts Models},
author = {Zeyu Shen and Peter Henderson},
journal= {arXiv preprint arXiv:2604.20156},
year = {2026}
}