中文

CPMobius:面向数据自由强化学习的迭代教练-球员推理

计算与语言 2026-05-26 v3 机器学习

摘要

大型语言模型(LLM)在复杂推理方面已显示出强大的潜力,但其进展 fundamentally 受限于依赖大量高质量的人类精选任务和标签,无论是通过监督微调(SFT)还是在推理特定数据上的强化学习(RL)。这种依赖使监督驱动的训练范式变得难以持续,实际应用中已经显示出规模效应的减弱迹象。在此基础上,我们引入CPMobius(CPMobius),一种用于推理模型数据自由强化学习的协作教练-球员范式。不同于传统的对抗性自我对弈,CPMobius受真实人类体育合作和多智能体合作的启发,将教练和球员视为独立但合作的角色。教练针对球员的能力提出针对性指令,并根据球员性能的变化获得奖励;而球员则因解决教练生成的日益具有挑战性的任务而获得奖励。这一合作优化循环旨在直接增强球员的数学推理能力。值得注意的是,CPMobius在不依赖任何外部训练数据的前提下实现了显著的性能提升,超越了现有无监督方法。例如,在Qwen2.5-Math-7B-Instruct上,我们的方法在整体准确率提升4.9个百分点,在分布外平均提升5.4个百分点,在整体准确率上超越RENT+1.5,在分布外准确率上超越R-zero+4.2。我们的 codebases已在 https://github.com/thunlp/CPMobius 上发布。

关键词

引用

@article{arxiv.2602.02979,
  title  = {CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning},
  author = {Ran Li and Zeyuan Liu and Yinghao Chen and Bingxiang He and Jiarui Yuan and Zixuan Fu and Weize Chen and Jinyi Hu and Chen Qian and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2602.02979},
  year   = {2026}
}

备注

Accepted to the ICML 2026