中文

DenoiseRL:从带噪前缀中恢复推理模型的无监督强化学习框架

人工智能 2026-05-28 v1

摘要

强化学习已成为推进大型语言模型推理能力的核心范式,但大多数现有方法仍依赖更强的教师模型或经过精心策划的困难数据集,限制了可扩展的能力提升。本文引入 DenoiseRL,一种强化学习框架,采用基于弱模型失败恢复的优化替代外部监督。无需依赖更强的监督或精心工程的数据,DenoiseRL 直接从错误的推理痕迹中学习,通过将其转化为改进的机会来实现更可扩展、更少依赖外部资源的训练。这产生了更丰富、更多样的学习信号,提高了来自不完美模型行为的探索效率。结果,DenoiseRL 在推理性能和整体训练效率上均取得提升,同时减少了昂贵数据策划或更强教师模型的需求。实验表明,DenoiseRL 在竞争的数学和一般推理基准上持续超过强大的基于策略的强化学习基线,并在训练难度增加时促进更强的自我纠错行为,凸显了一种有效且可扩展的大型语言模型推理能力提升路径。

关键词

引用

@article{arxiv.2605.28421,
  title  = {DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes},
  author = {Caijun Xu and Changyi Xiao and Zhongyuan Peng and Yixin Cao},
  journal= {arXiv preprint arXiv:2605.28421},
  year   = {2026}
}

备注

17 pages, 6 figures