面向混合专家模型的稳定高效强化学习
机器学习
2026-01-13 v2 计算与语言
摘要
近期在强化学习(RL)方面的进展显著改善了大规模语言模型的训练,带来了生成质量和推理能力的显著提升。然而,大多数现有研究聚焦于稠密模型,而针对混合专家(Mixture-of-Experts,MoE)架构的RL训练仍鲜有探索。为解决MoE训练中常见的不稳定问题,我们提出了一种新颖的路由器感知方法,用于优化离策略RL中的重要性抽样(importance sampling,IS)权重。具体而言,我们设计了一种由路由器逻辑数引导的重新缩放策略,有效减少梯度方差并缓解训练发散。实验结果表明,我们的方法显著改进了MoE模型的收敛稳定性和最终性能,凸显了针对MoE架构量身定制的RL算法创新潜力,并为高效训练大规模专家模型提供了可行路径。
引用
@article{arxiv.2510.23027,
title = {Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts},
author = {Di Zhang and Xun Wu and Shaohan Huang and Lingjie Jiang and Yaru Hao and Li Dong and Zewen Chi and Zhifang Sui and Furu Wei},
journal= {arXiv preprint arXiv:2510.23027},
year = {2026}
}
备注
Added additional experiments, improved analysis, and fixed minor issues