S2J: 弥合生成式奖励模型中求解能力与判断能力之间的差距
计算与语言
2025-09-29 v1
摘要
随着大型语言模型(LLM)的快速发展,生成式奖励模型(GRM)已被广泛用于奖励建模与评估。此前研究主要通过在偏好数据集上优化 GRM,以判断正确性作为监督信号来训练专用的 GRM。虽然普遍认为具有更强问题求解能力的 GRM 通常表现出更优的判断能力,但我们在检查单个查询时首次发现了一个显著的求解-判断差距。具体而言,求解-判断差距指的是 GRM 在完全有能力求解某些查询的情况下,仍难以对这些查询做出正确判断(14%-37%)的现象。在本文中,我们提出了求解-判断(S2J)方法来应对这一问题。具体来说,S2J 同时利用单个 GRM 输出中的求解与判断能力进行监督,在模型优化过程中显式地关联 GRM 的问题求解与评估能力,从而缩小该差距。我们的全面实验表明,S2J 有效将求解-判断差距缩小了 16.2%,从而将模型的判断性能提升了 5.8%。值得注意的是,S2J 在基于相同基础模型构建的 GRM 中达到了最先进的(SOTA)性能,同时使用了显著更小的训练数据集。此外,S2J 通过自我演化实现这一目标,无需依赖更强大的外部模型进行蒸馏。
引用
@article{arxiv.2509.22099,
title = {S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models},
author = {Shaoning Sun and Jiachen Yu and Zongqi Wang and Xuewei Yang and Tianle Gu and Yujiu Yang},
journal= {arXiv preprint arXiv:2509.22099},
year = {2025}
}