中文

每个提示都至关重要:在千亿规模MoE上不浪费展开的强化学习扩展

人工智能 2025-12-09 v1 机器学习

摘要

我们提出了CompassMax-V3-Thinking,这是一个千亿规模的MoE推理模型,基于一个原则训练的新RL框架:每个提示都必须至关重要。将RL扩展到这种规模暴露了关键的效率问题——零方差提示浪费展开、长视界上不稳定的重要性采样、标准奖励模型导致的优势反转,以及展开处理中的系统性瓶颈。为了克服这些挑战,我们引入了几个统一的创新:(1)多阶段零方差消除,通过过滤掉非信息性提示并移除浪费的展开来稳定基于组的策略优化(例如GRPO);(2)ESPO,一种熵自适应优化方法,平衡token级和序列级重要性采样以维持稳定的学习动态;(3)路由器重放策略,使训练时的MoE路由器决策与推理时的行为对齐以缓解训练-推理差异,并结合奖励模型调整以防止优势反转;(4)一个高吞吐量RL系统,采用FP8精度展开、重叠奖励计算和长度感知调度以消除性能瓶颈。这些贡献共同形成了一个连贯的流水线,使得在千亿规模MoE模型上的RL稳定且高效。最终模型在内部和公开评估中均表现出强劲性能。

关键词

引用

@article{arxiv.2512.07710,
  title  = {Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE},
  author = {Anxiang Zeng and Haibo Zhang and Hailing Zhang and Kaixiang Mo and Liang Yao and Ling Hu and Long Zhang and Shuman Liu and Shuyi Xie and Yanshi Li and Yizhang Chen and Yuepeng Sheng and Yuwei Huang and Zhaochen Xu and Zhiqiang Zhou and Ziqin Liew},
  journal= {arXiv preprint arXiv:2512.07710},
  year   = {2025}
}