ConsistRM:通过一致性感知自训练改进生成式奖励模型
人工智能
2026-04-21 v2 计算与语言
机器学习
摘要
生成式奖励模型 (GRM) 已成为一种有前景的方法,通过提供比传统标量奖励模型更大的表示能力和灵活性来使大型语言模型 (LLM) 与人类偏好对齐。然而,GRM 面临两个主要挑战:对昂贵的人工标注数据的依赖限制了可扩展性,而自训练方法通常遭受不稳定性并易受奖励破解的影响。为了解决这些问题,我们提出了 ConsistRM,一个无需人工标注即可实现有效且稳定 GRM 训练的自训练框架。ConsistRM 包含一致性感知答案奖励,它利用时间一致性产生可靠的伪标签,从而提供更稳定的模型优化。此外,引入了一致性感知评论奖励来评估多个评论之间的语义一致性,并分配细粒度且差异化的奖励。在四个基础模型上的五个基准数据集上的实验表明,ConsistRM 平均优于普通强化微调 (RFT) 1.5%。进一步的分析表明,ConsistRM 增强了输出一致性并减轻了由输入顺序引起的位置偏差,突出了一致性感知奖励在改进 GRM 方面的有效性。我们的实现可在 https://github.com/yuliangCarmelo/ConsistRM 获取。
引用
@article{arxiv.2604.07484,
title = {ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training},
author = {Yu Liang and Liangxin Liu and Longzheng Wang and Yan Wang and Yueyang Zhang and Long Xia and Zhiyuan Sun and Daiting Shi},
journal= {arXiv preprint arXiv:2604.07484},
year = {2026}
}
备注
Published as a Main conference paper at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)