中文

随机策略评估足以用于带可验证奖励的 LLM 推理

机器学习 2025-09-30 v1 人工智能

摘要

RL with Verifiable Rewards (RLVR) 已成为提高大型语言模型 (LLMs) 推理能力的有前景范例。当前方法主要依赖 PPO 和 GRPO 等策略优化框架,这些框架遵循广义策略迭代,即在评估当前策略价值后改进策略。虽然有效,但常常 suffer from training instability and diversity collapse,需要复杂的启发式技巧和精心的调参。在我们看来,RLVR 在数学推理中可以形式化为一种特殊的有限时域马尔可夫决策过程,其具有确定性状态转换、树状结构动力学和二进制终端奖励。虽然规模巨大,但 underlying 结构比通用控制设置(例如 PPO 所针对的设置)要简单得多,暗示着现有方法中的许多高级技术可能被简化甚至省略。在此基础上,我们证明了一个惊人的结论:可以从固定均匀随机策略的 Q 函数中恢复最优动作,从而绕过广义策略迭代循环及其相关的启发式。在此基础上,我们提出了 Random Policy Valuation for Diverse Reasoning (ROVER),将这一原理转化为一种实用且可扩展的 LLM 数学推理算法。ROVER 以从这些均匀策略 Q 值上进行 softmax 的方式抽样动作,是一个极简却高度有效的 RL 方法。ROVER 在训练期间保持 diversity,允许对多个有效路径进行持续探索。在多个 base 模型和标准数学推理基准测试中,ROVER 在 quality(pass@1 上提升 +8.2,在 pass@256 上提升 +16.8)和 diversity(提升 +17.6%)方面均表现出色,尽管其与强大且复杂的现有方法相比进行了激进的简化。

关键词

引用

@article{arxiv.2509.24981,
  title  = {Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards},
  author = {Haoran He and Yuxiao Ye and Qingpeng Cai and Chen Hu and Binxing Jiao and Daxin Jiang and Ling Pan},
  journal= {arXiv preprint arXiv:2509.24981},
  year   = {2025}
}

备注

32 pages