R^3:用于 LLM 强化学习的回放、反射和排序奖励
机器学习
2026-01-29 v2 人工智能
摘要
大规模推理模型(LRMs)旨在通过结构化推理来解决多样且复杂的问题。最近在基于群体的政策优化方法方面的进展显示出在不依赖过程级注释的情况下实现稳定优势估计的前景。然而,这些方法依赖于同一批次中高质量样本导致的优势间隙,这使得在面对具有挑战性任务时,训练过程容易崩溃且效率低下。为了解决这些问题,我们提出了一种名为\emph{\textbf{R^3}}的强化学习机制,沿着三个方向:(1)一个\emph{跨语境\underline{\textbf{R}}eplay}策略通过回想同一查询的历史轨迹中有价值的示例来保持群体内优势,(2)一个\emph{在上下文内自-\underline{\textbf{R}}eflection}机制使模型能够通过利用过去的失败来细化输出,(3)一个\emph{结构熵\underline{\textbf{R}}anking奖励},该奖励通过基于令牌级熵模式对截断或失败的样本进行排序来分配相对奖励,捕捉局部探索和全局稳定性。我们在Deepseek-R1-Distill-Qwen-1.5B上实现该方法,并在数学领域的DeepscaleR-40k上进行训练。实验表明,我们的方法在几个数学基准测试上实现了SoTA性能,显著改善了基本模型的表现,并减少了推理令牌数。代码和模型将公开发布。
引用
@article{arxiv.2601.19620,
title = {R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning},
author = {Zhizheng Jiang and Kang Zhao and Weikai Xu and Xinkui Lin and Wei Liu and Jian Luan and Shuo Shang and Peng Han},
journal= {arXiv preprint arXiv:2601.19620},
year = {2026}
}