PairJudge RM:基于淘汰赛制的 Best-of-N 采样
计算与语言
2025-02-20 v2
摘要
Best-of-N (BoN) 采样是大型语言模型(LLM)测试时扩展的一种常用策略,它依赖奖励模型从多次生成中选择最佳候选解。然而,传统的奖励模型通常会给出任意且不一致的分数,限制了其有效性。为了解决这一问题,我们提出了一种结合淘汰赛制进行 BoN 采样的成对评判奖励模型(Pairwise Judge Reward Model, PairJudge RM)。PariJudge RM 不再分配绝对分数,而是针对一个数学问题,同时利用思维链推理判断两个候选解的正确性。这种方法消除了打分的需求,并能够通过并行评判实现对解的交叉验证。在淘汰赛中,PariJudge RM 在候选解之间进行成对评判,并迭代地淘汰不正确的解。我们构建了 PairJudge-432K,这是一个包含 432K 次成对评判的大规模数据集,该数据集源自 NumiaMath 并使用 \texttt{gemini-1.5-flash} 进行标注,随后通过监督微调训练 PariJudge RM。在 MATH-500 和 Olympiad Bench 上的实验表明,该方法相比基线奖励模型有显著提升。并且在排名前 50% 的难题上实现了 40\% 到 60\% 的相对提升。
引用
@article{arxiv.2501.13007,
title = {PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament},
author = {Yantao Liu and Zijun Yao and Rui Min and Yixin Cao and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2501.13007},
year = {2025}
}
备注
in progress work