中文

GRAM-R²:基于自训练生成式奖励模型奖励推理

计算与语言 2025-11-18 v3 机器学习

摘要

近年来,随着从任务特定设计向通用奖励模型范式的转变,奖励建模取得了显著进展。尽管存在这一趋势,但开发有效的奖励模型仍是根本性挑战:高度依赖大规模标记偏好数据。在丰富无标签数据上进行预训练是一条有前景的道路,但现有方法不足以在奖励模型中植入显式推理能力。为弥合这一差距,我们提出一种自训练方法,利用无标签数据以激发奖励模型中的奖励推理。在此基础上,我们开发了GRAM-R²(Generative Reward Model with self-Training for Reward Reasoning),该模型被训练既生成偏好标签,又生成伴随的奖励理由。GRAM-R²可作为奖励推理的基础模型,可应用于多种任务,无需或最小化额外微调。它支持响应排序和特定任务奖励调优等下游应用。实验在响应排序、任务适应和从人类反馈获取强化学习方面表明,GRAM-R² consistently 能提供卓越的性能,优于多个强判别式和生成式基线。

关键词

引用

@article{arxiv.2509.02492,
  title  = {GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning},
  author = {Chenglong Wang and Yongyu Mu and Hang Zhou and Yifu Huo and Ziming Zhu and Jiali Zeng and Murun Yang and Bei Li and Xiaoyang Hao and Chunliang Zhang and Fandong Meng and Jingbo Zhu and Tong Xiao},
  journal= {arXiv preprint arXiv:2509.02492},
  year   = {2025}
}

备注

Accepted by AAAI 2026