无验证器强化学习的语言模型激励训练-NOVER
计算与语言
2025-09-04 v2 人工智能
机器学习
摘要
最近的进展如DeepSeek R1-Zero凸显了激励训练的有效性,这是一种强化学习范例,仅基于语言模型输出最终答案部分计算奖励,从而鼓励生成中间推理步骤。然而,这些方法本质上依赖于外部验证器,这限制了其在数学和编码等领域的适用性,因为这些领域 readily available 外部验证器。虽然奖励模型可作为验证器,但需要高质量标注数据且训练成本高昂。本文提出NOVER,无验证器强化学习,一种需要仅使用标准监督微调数据即可实现的通用强化学习框架,无需外部验证器。NOVER实现了跨广泛文本到文本任务的激励训练,并以DeepSeek R1 671B等大规模推理模型蒸馏的模型相比提高了7.7%。此外,NOVER的灵活性开启了优化大型语言模型的新可能性,如逆向激励训练。
引用
@article{arxiv.2505.16022,
title = {NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning},
author = {Wei Liu and Siya Qi and Xinyu Wang and Chen Qian and Yali Du and Yulan He},
journal= {arXiv preprint arXiv:2505.16022},
year = {2025}
}
备注
20 pages, 5 tables, 12 figures. accepted to EMNLP 2025