中文

联合奖励建模:高效视觉奖励模型中的链式思维内化

人工智能 2026-02-10 v1

摘要

奖励模型对强化学习从人类反馈至关重要,因为它们决定了生成模型的对齐质量和可靠性。对于图像编辑等复杂任务,奖励模型需要捕捉全局语义一致性和隐式逻辑约束,而不仅仅是局部相似性。现有的奖励建模方法存在明显局限性。判别式奖励模型与人类偏好一致,但因推理监督有限而难以处理复杂语义。生成式奖励模型在语义理解和推理方面具有更强能力,但在推理时成本高昂且难以直接与人类偏好对齐。为此,我们提出了联合奖励建模(JRM),该方法在共享的视觉-语言 backbone 上联合优化偏好学习和语言建模。该方法将生成模型的语义和推理能力内化到高效的判别表示中,实现快速而准确的评估。JRM 在 MMRB2 和 EditReward-Bench 上实现了最先进的成绩,并在下游在线强化学习中显著提升了稳定性和性能。这表明联合训练有效地在奖励建模中实现了效率与语义理解之间的平衡。

关键词

引用

@article{arxiv.2602.07533,
  title  = {Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models},
  author = {Yankai Yang and Yancheng Long and Hongyang Wei and Wei Chen and Tianke Zhang and Kaiyu Jiang and Haonan Fan and Changyi Liu and Jiankang Chen and Kaiyu Tang and Bin Wen and Fan Yang and Tingting Gao and Han Li and Shuo Yang},
  journal= {arXiv preprint arXiv:2602.07533},
  year   = {2026}
}