中文

一次判定:单前向传递中的多响应奖励建模

计算机视觉与模式识别 2026-04-17 v2 人工智能

摘要

我们提出了一种判别式多模态奖励模型,能够在单次前向传递中对所有候选响应进行评分。传统的判别式奖励模型需要对每个候选响应独立评估,需进行多个前向传递。我们的方法将多个响应拼接并使用分隔符标记,然后对其标量得分进行交叉熵,从而实现直接的比较推理和高效的N向偏好学习。多响应设计还可使我们在常规单响应评分之上实现最高可达N倍的吞吐量加速和FLOPs降低。为支持超越现有两两基准的N向奖励评估,我们构建了两个新基准:(1) MR2^2Bench-Image包含来自8个 diverse 模型的响应的人工标注排名;(2) MR2^2Bench-Video 是一个大型基于视频的奖励基准,源自94K个众包两两人类判断,对视频问答进行标注,涵盖19个模型,通过偏好图集合进行去噪。两个基准都提供了从完整排名中抽样的4响应评估变体。基于4B视觉语言主干模型进行LoRA微调并配备轻量级MLP价值头,我们的模型在六个多模态奖励基准中实现了最先进的结果,包括MR2^2Bench-Image、MR2^2Bench-Video以及四个其他现有基准。我们的模型在常规多模态奖励基准上超越了现有的更大生成式和判别式奖励模型。我们进一步展示了当我们的奖励模型用于GRPO强化学习时,可产生改进的策略模型,保持在标准多模态基准上的性能,同时显著提升开放式生成质量,相较于单响应判别式奖励模型基线在训练稳定性和开放式生成质量上均取得显著优势。

关键词

引用

@article{arxiv.2604.10966,
  title  = {You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass},
  author = {Yinuo Yang and Zixian Ma and Manasi Ganti and Jieyu Zhang and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2604.10966},
  year   = {2026}
}

备注

9 pages, 4 figures