从可验证点到奖励链:利用基于可验证参考的奖励进行开放式生成的强化学习
计算与语言
2026-01-27 v1
摘要
带有可验证奖励的强化学习 (RLVR) 通过检查最终可验证答案(即可验证点信号)在推理任务(例如数学和代码)中取得了成功。然而,将这一范式扩展到开放式生成具有挑战性,因为没有明确的真实基准。依赖单点监督通常会导致效率和奖励黑客问题。为了解决这些问题,我们提出了带有基于可验证参考的奖励的强化学习 (RLVRR)。RLVRR 不检查最终答案,而是从高质量参考中提取有序的语言信号(即奖励链)。具体而言,RLVRR 将奖励分解为两个维度:内容,保留确定性的核心概念(如关键词);风格,通过基于 LLM 的验证来评估对风格属性的遵循。通过这种方式,RLVRR 将 RL 的探索能力与监督微调 (SFT) 的效率和可靠性结合起来。在超过 10 个基准测试上使用 Qwen 和 Llama 模型进行的广泛实验证实了我们方法的优势。RLVRR (1) 大大优于使用十倍数据训练的 SFT 和先进的奖励模型,(2) 统一了结构化推理和开放式生成的训练,(3) 在保持输出多样性的同时更有效地泛化。这些结果确立了 RLVRR 作为通用 LLM 对齐的可验证强化学习的一条有原则且高效的路径。我们在 https://github.com/YJiangcm/RLVRR 发布了我们的代码和数据。
引用
@article{arxiv.2601.18533,
title = {From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation},
author = {Yuxin Jiang and Yufei Wang and Qiyuan Zhang and Xingshan Zeng and Liangyou Li and Jierun Chen and Chaofan Tao and Haoli Bai and Lifeng Shang},
journal= {arXiv preprint arXiv:2601.18533},
year = {2026}
}
备注
19 pages, 8 figures, 12 tables. Accepted at ICLR 2026