Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
摘要
大型语言模型 (LLM) 的测试时扩展 (TTS) 目前主要分为两种互相分离的范式:(1) 强化学习 (RL) 方法通过稀疏结果导向奖励进行优化,却受限于不稳定性和低采样效率;(2) 基于独立训练的静态过程奖励模型 (PRM) 指导的搜索技术,需要昂贵的人类或 LLM 生成标签,并且在分布迁移下常常性能下降。在本文中,我们引入 AIRL-S,即 RL 基于和搜索技术的自然统一方法。AIRL-S 的核心洞见在于,RL 训练期间学习到的奖励函数本身代表了引导下游搜索的理想 PRM。具体而言,我们利用对抗式逆强化学习 (AIRL) 结合群体相对策略优化 (GRPO) 从正确推理痕迹中学习稠密、动态的 PRM,从而完全消除对标记中间过程数据的需求。在推断阶段,所得 PRM同时作为 RL 滚动的评论家,也作为有效引导搜索程序的启发式方法,促进推理链的稳健扩展,缓解奖励入侵,并增强跨任务泛化。在八项基准测试(包括数学、科学推理和代码生成)上的实验结果表明,统一方法平均提高基线模型性能 9%,达到 GPT-4o 水平。 Furthermore, when integrated into multiple search algorithms, our PRM consistently outperforms all baseline PRMs trained with labeled data. These results underscore that, indeed, your reward function for RL is your best PRM for search, providing a robust and cost-effective solution to complex reasoning tasks in LLMs.
引用
@article{arxiv.2508.14313,
title = {Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS},
author = {Can Jin and Yang Zhou and Qixin Zhang and Hongwu Peng and Di Zhang and Zihan Dong and Marco Pavone and Ligong Han and Zhang-Wei Hong and Tong Che and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2508.14313},
year = {2026}
}