从结果到过程:通过 ORM 引导 PRM 学习以实现推理时对齐
计算与语言
2025-07-01 v2
摘要
推理时对齐方法因其高效性和有效性在对齐大语言模型(LLMs)与人类偏好方面获得了广泛关注。然而,现有主导的基于奖励引导搜索(RGS)的方法主要依赖结果奖励模型(ORM),其存在一个关键的粒度不匹配问题:ORM 旨在为完整回复提供结果奖励,而 RGS 方法依赖过程奖励来引导策略,导致评分不一致和对齐效果欠佳。为应对这一挑战,我们将过程奖励模型(PRM)引入 RGS,并论证理想的 PRM 应满足两个目标:评分一致性,确保对部分回复和完整回复的评估连贯一致;偏好一致性,使部分序列评估与人类偏好对齐。基于此,我们提出 SP-PRM,一个新颖的双一致性框架,集成基于评分一致性和基于偏好一致性的部分评估模块,且不依赖人工标注。在对话、摘要和推理任务上的大量实验表明,SP-PRM 显著增强了现有的 RGS 方法,在所有任务上 GPT-4 评估分数提升了 3.6%–10.3%。
引用
@article{arxiv.2506.12446,
title = {From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment},
author = {Bin Xie and Bingbing Xu and Yige Yuan and Shengmao Zhu and Huawei Shen},
journal= {arXiv preprint arXiv:2506.12446},
year = {2025}
}