中文

超越可验证奖励:将语言模型的强化学习扩展至不可验证数据

机器学习 2025-05-29 v2

摘要

我们提出使用一种新颖的算法JEPO(Jensen证据下界策略优化)将强化学习(RL)扩展至不可验证数据。虽然先前大多数关于扩展LLM强化学习的工作都集中在可验证数据上,其中真实答案通常是短形式的且易于匹配;但我们研究了此类假设不太成立的情况(例如,当答案为长形式时,如数学证明)。为了在当代训练约束下将强化学习训练扩展至不可验证数据,我们提出了JEPO。JEPO应用了Jensen证据下界,这是证据下界的一种实用简化,它将思维链视为生成过程中的潜变量。我们表明,在可验证数据(数学)上,JEPO与使用可验证奖励的强化学习一样有效;在半可验证数据(numina)上,与只能利用数据源子集的使用可验证奖励的强化学习相比,JEPO在基于软匹配的评估上有所改进;最后,在不可验证数据(numina-proof)上,JEPO在似然性评估上优于SFT和几个消融基线。

关键词

引用

@article{arxiv.2503.19618,
  title  = {Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data},
  author = {Yunhao Tang and Sid Wang and Lovish Madaan and Rémi Munos},
  journal= {arXiv preprint arXiv:2503.19618},
  year   = {2025}
}