通过对齐训练与推理路由器来稳定 Mixture-of-Experts 强化学习
计算与语言
2025-10-22 v2 人工智能
机器学习
摘要
强化学习(RL)已成为增强大型语言模型能力的关键方法。然而,在Mixture-of-Experts(MoE)模型中,路由机制常导致训练不稳定,甚至引发灾难性的RL训练崩溃。我们分析了MoE模型在训练和推理阶段的路由一致性,发现二者之间存在显著的路由行为差异。此外,即使在相同条件下,路由框架也可能在多次前向传递中导致专家选择的差异。为解决这一根本性不一致性,我们提出了一种Rollout Routing Replay(R3)方法,该方法记录推理引擎中的路由分布并在训练时进行回放。R3显著减少了训练-推理策略KL散度,减轻了极端差异,同时不影响训练速度。广泛的实验表明,R3成功稳定了RL训练,防止了崩溃,并优于GSPO和TIS等方法。我们认为本工作为稳定MoE模型中的RL提供了新的解决方案。
引用
@article{arxiv.2510.11370,
title = {Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers},
author = {Wenhan Ma and Hailin Zhang and Liang Zhao and Yifan Song and Yudong Wang and Zhifang Sui and Fuli Luo},
journal= {arXiv preprint arXiv:2510.11370},
year = {2025}
}