中文

先假装成功再真正成功:将奖励建模作为判别式预测

计算机视觉与模式识别 2025-06-27 v2 人工智能 机器学习

摘要

有效的奖励模型在强化学习中对视觉生成模型的后训练增强起着关键作用。然而,当前奖励建模方法因依赖大量人工标注的偏好数据或精心设计的、往往不完整且工程密集的质量维度而面临实现复杂度高的问题。受生成对抗网络(GANs)中对抗训练的启发,本文提出 GAN-RM,一种高效的奖励建模框架,无需人工偏好标注和显式的质量维度工程。我们的方法通过区分少量代表性、无配对的目标样本(称为偏好代理数据)与模型生成的普通输出来训练奖励模型,仅需几百个目标样本。大量实验证明了 GAN-RM 在多个关键应用中的有效性,包括以 Best-of-N 样本筛选实现的测试时缩放,以及后训练方法如监督微调(SFT)和直接偏好优化(DPO)。代码和数据将发布于 https://github.com/Visualignment/GAN-RM。

关键词

引用

@article{arxiv.2506.13846,
  title  = {Fake it till You Make it: Reward Modeling as Discriminative Prediction},
  author = {Runtao Liu and Jiahao Zhan and Yingqing He and Chen Wei and Alan Yuille and Qifeng Chen},
  journal= {arXiv preprint arXiv:2506.13846},
  year   = {2025}
}