Skywork-VL Reward:一种用于多模态理解与推理的有效奖励模型
计算机视觉与模式识别
2025-06-10 v2
摘要
我们提出了Skywork-VL Reward,这是一种多模态奖励模型,可为多模态理解和推理任务提供奖励信号。我们的技术方法包含两个关键组成部分:首先,我们构建了一个大规模多模态偏好数据集,该数据集覆盖了广泛的任务和场景,其响应收集自标准视觉语言模型(VLM)和先进的VLM推理器。其次,我们基于Qwen2.5-VL-7B-Instruct设计了一种奖励模型架构,集成了一个奖励头,并利用成对偏好数据上的成对排序损失进行多阶段微调。实验评估表明,Skywork-VL Reward在多模态VL-RewardBench上取得了最先进的结果,并在纯文本RewardBench基准上展现出有竞争力的性能。此外,基于我们的Skywork-VL Reward构建的偏好数据被证明对于训练混合偏好优化(MPO)非常有效,从而显著提升了多模态推理能力。我们的结果凸显了Skywork-VL Reward是迈向通用、可靠的多模态对齐奖励模型的重要一步。我们的模型已公开发布,以促进透明度和可复现性。
引用
@article{arxiv.2505.07263,
title = {Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning},
author = {Xiaokun Wang and Peiyu Wang and Jiangbo Pei and Wei Shen and Yi Peng and Yunzhuo Hao and Weijie Qiu and Ai Jian and Tianyidan Xie and Xuchen Song and Yang Liu and Yahui Zhou},
journal= {arXiv preprint arXiv:2505.07263},
year = {2025}
}