学习推理需要推理:无标签强化学习在弱基础模型中的局限性
机器学习
2025-11-10 v1 人工智能
摘要
大型语言模型的最新进展证明了无监督强化学习(RL)方法在无外部监督下增强推理能力的潜力。然而,这些无标签 RL 方法对于推理能力有限的较小基础模型的泛化能力仍未被探索。在本工作中,我们系统地研究了无标签 RL 方法在不同模型规模和推理强度(从 0.5B 到 7B 参数)下的性能。我们的实证分析揭示了关键局限性:无标签 RL 高度依赖基础模型预存的推理能力,对于较弱的模型,其性能通常会退化至基线水平以下。我们发现,较小的模型无法生成足够长或足够多样的思维链推理以实现有效的自我反思,并且训练数据难度在决定成败中起着至关重要的作用。为了应对这些挑战,我们提出了一种简单而有效的无标签 RL 方法,该方法利用课程学习在训练过程中逐步引入更难的问题,并在训练期间掩蔽非多数的 rollout。此外,我们引入了数据筛选流程以生成具有预定义难度的样本。我们的方法在所有模型规模和推理能力上均展现出一致的提升,为在资源受限模型中通过自举获得推理能力的更鲁棒的无监督 RL 提供了一条路径。我们的代码发布于 https://github.com/BorealisAI/CuMa
引用
@article{arxiv.2511.04902,
title = {You Need Reasoning to Learn Reasoning: The Limitations of Label-Free RL in Weak Base Models},
author = {Shuvendu Roy and Hossein Hajimirsadeghi and Mengyao Zhai and Golnoosh Samei},
journal= {arXiv preprint arXiv:2511.04902},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MATH-AI