中文

动态且通用的过程奖励建模

计算与语言 2025-07-25 v1

摘要

过程奖励模型(PRMs)是指导大型语言模型(LLMs)在复杂情境下提供稠密奖励信号的关键技术。然而,现有PRMs主要依赖启发式方法,难以实现跨领域的泛化。虽然提出了 LLM-as-judge 以提供通用奖励,但当前研究主要聚焦于反馈结果,忽略了文本中蕴含的有意义指导。此外,静态且粗粒度的评估标准难以适应复杂的过程监督。为此,我们提出动态且通用的过程奖励建模(DG-PRM),其特点是构建奖励树来捕获和存储细粒度、多维度的奖励标准。DG-PRM 能动态选择奖励信号用于逐步奖励评分。为处理多维奖励信号,我们首次采用帕累托支配估计来识别判别性的正负配对。实验结果表明,DG-PRM 在主流基准测试上实现卓越的性能,显著提升了稠密奖励任务中的模型性能。进一步分析表明,DG-PRM 在分布外场景下也表现出色,展现出惊人的通用性。

关键词

引用

@article{arxiv.2507.17849,
  title  = {Dynamic and Generalizable Process Reward Modeling},
  author = {Zhangyue Yin and Qiushi Sun and Zhiyuan Zeng and Qinyuan Cheng and Xipeng Qiu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2507.17849},
  year   = {2025}
}

备注

Accepted by ACL 2025 Main