中文

BaseReward:多模态奖励模型的强基线

计算机视觉与模式识别 2025-09-22 v1

摘要

多模态大语言模型(MLLMs)的快速发展使得使其与人类偏好对齐成为一项关键挑战。奖励模型(RMs)是实现这一目标的核心技术,但目前学术界和工业界都缺乏构建最先进多模态奖励模型的系统性指南。通过详尽的实验分析,本文旨在为构建高性能 MRMs 提供清晰的“配方”。我们系统地研究了 MRM 开发流程中的每个关键组件,包括\textit{奖励建模范式}(例如 Naive-RM、Critic-based RM 和 Generative RM)、\textit{奖励头架构}、\textit{训练策略}、\textit{数据筛选}(涵盖十余个多模态和纯文本偏好数据集)、\textit{骨干模型}与\textit{模型规模},以及\textit{集成方法}。基于这些实验洞察,我们引入了 \textbf{BaseReward},一个强大且高效的多模态奖励建模基线。BaseReward 采用简单而有效的架构,建立在 {Qwen2.5-VL} 骨干网络之上,具有优化的双层奖励头,并在精心筛选的高质量多模态和纯文本偏好数据混合上进行训练。我们的结果表明,BaseReward 在 MM-RLHF-Reward Bench、VL-Reward Bench 和 Multimodal Reward Bench 等主要基准上确立了新的 SOTA,超越了以往的模型。此外,为了验证其在静态基准之外的实用价值,我们将 BaseReward 集成到真实的强化学习流程中,成功增强了 MLLM 在各种感知、推理和对话任务中的性能。这项工作不仅提供了一个顶级的 MRM,更重要的是,为社区提供了一份清晰、基于经验的指南,以开发用于下一代 MLLMs 的稳健奖励模型。

关键词

引用

@article{arxiv.2509.16127,
  title  = {BaseReward: A Strong Baseline for Multimodal Reward Model},
  author = {Yi-Fan Zhang and Haihua Yang and Huanyu Zhang and Yang Shi and Zezhou Chen and Haochen Tian and Chaoyou Fu and Haotian Wang and Kai Wu and Bo Cui and Xu Wang and Jianfei Pan and Haotian Wang and Zhang Zhang and Liang Wang},
  journal= {arXiv preprint arXiv:2509.16127},
  year   = {2025}
}