中文

Ring-lite:基于 C3PO 稳定强化学习的可扩展推理

计算与语言 2025-06-19 v2 人工智能

摘要

我们提出了 Ring-lite,这是一种基于混合专家(Mixture-of-Experts, MoE)的大型语言模型,通过强化学习(RL)优化以实现高效且稳健的推理能力。基于公开的 Ling-lite 模型构建,该模型拥有 168 亿参数,其中激活参数为 27.5 亿。我们的方法在诸如 AIME、LiveCodeBench、GPQA-Diamond 等具有挑战性的基准测试上匹配了最先进(SOTA)小规模推理模型的性能,同时仅激活与可比模型所需参数的三分之一。为实现这一目标,我们引入了将蒸馏与 RL 集成的联合训练管道,揭示了 MoE RL 训练中的一些不常见挑战。首先,我们识别了 RL 训练中的优化不稳定性,提出了受约束的上下文计算策略优化(Constrained Contextual Computation Policy Optimization, C3PO),通过算法-系统协同设计方法提升训练稳定性并提高计算吞吐量。其次,我们实证表明,基于熵损失选择蒸馏检查点进行 RL 训练,而非验证指标,可在后续 RL 训练中实现更佳的性能-效率权衡。最后,我们发展了两阶段训练范式来协调多域数据集成,解决在混合数据集训练中出现的领域冲突。我们将发布该模型、数据集和代码。

关键词

引用

@article{arxiv.2506.14731,
  title  = {Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs},
  author = {Ling Team and Bin Hu and Cai Chen and Deng Zhao and Ding Liu and Dingnan Jin and Feng Zhu and Hao Dai and Hongzhi Luan and Jia Guo and Jiaming Liu and Jiewei Wu and Jun Mei and Jun Zhou and Junbo Zhao and Junwu Xiong and Kaihong Zhang and Kuan Xu and Lei Liang and Liang Jiang and Liangcheng Fu and Longfei Zheng and Qiang Gao and Qing Cui and Quan Wan and Shaomian Zheng and Shuaicheng Li and Tongkai Yang and Wang Ren and Xiaodong Yan and Xiaopei Wan and Xiaoyun Feng and Xin Zhao and Xinxing Yang and Xinyu Kong and Xuemin Yang and Yang Li and Yingting Wu and Yongkang Liu and Zhankai Xu and Zhenduo Zhang and Zhenglei Zhou and Zhenyu Huang and Zhiqiang Zhang and Zihao Wang and Zujie Wen},
  journal= {arXiv preprint arXiv:2506.14731},
  year   = {2025}
}

备注

Technical Report