中文

基于掩码-重排自监督的可验证奖励强化学习

计算与语言 2025-11-24 v1 人工智能 机器学习

摘要

测试时扩展被证明可显著提高大型语言模型(LLM)的数学推理能力。然而,对于大量数学语料库,特别是定理证明,RLVR的可扩展性受限:中间推理至关重要,而最终答案难以直接可靠地验证。此外,基于标记的SFT常常退化为机械记忆,而难以诱导更长的思考链。灵感来自BERT的自监督任务,我们提出MR-RLVR(Masked-and-Reordered RLVR),通过“掩码后填充”和“步骤重排序”构建过程级自监督奖励,从中间推理中提取可学习的信号。我们的训练管道包含两个阶段:我们首先对抽样的数学计算和证明数据进行自监督训练;然后在仅有结果可验证的数学计算数据集上进行RLVR微调。我们在Qwen2.5-3B和DeepSeek-R1-Distill-Qwen-1.5B上实现MR-RLVR,并在AIME24、AIME25、AMC23和MATH500上进行评估。在固定抽样和解码预算下,MR-RLVR相对于原始RLVR实现了+9.86% Pass@1、+5.27% Pass@5和+4.00% Pass@8的平均相对提升。这表明 incorporating process-aware自监督信号可以有效增强RLVR在仅结果可验证设置下的可扩展性和性能。

关键词

引用

@article{arxiv.2511.17473,
  title  = {Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards},
  author = {Zhen Wang and Zhifeng Gao and Guolin Ke},
  journal= {arXiv preprint arXiv:2511.17473},
  year   = {2025}
}