InternLM-XComposer2.5-Reward:一个简单而有效的多模态奖励模型
计算机视觉与模式识别
2025-05-21 v2 计算与语言
摘要
尽管大型视觉语言模型(LVLMs)在视觉理解方面表现出色,但它们偶尔会产生错误的输出。虽然带有强化学习或测试时缩放的奖励模型(RMs)提供了提升生成质量的潜力,但一个关键的缺口仍然存在:用于LVLMs的公开多模态RM稀缺,且专有模型的实现细节往往不清晰。我们通过InternLM-XComposer2.5-Reward(IXC-2.5-Reward)弥补了这一缺口,这是一个简单而有效的多模态奖励模型,旨在使LVLMs与人类偏好对齐。为确保IXC-2.5-Reward的鲁棒性和多功能性,我们构建了一个高质量的多模态偏好语料库,涵盖文本、图像和视频输入,涉及指令遵循、通用理解、富文本文档、数学推理和视频理解等多个领域。IXC-2.5-Reward在最新的多模态奖励模型基准测试中取得了优异结果,并在纯文本奖励模型基准测试中表现出有竞争力的性能。我们进一步展示了IXC-2.5-Reward的三个关键应用:(1)为RL训练提供监督信号。我们将IXC-2.5-Reward与近端策略优化(PPO)集成,得到了IXC-2.5-Chat,它在指令遵循和多模态开放式对话方面表现出一致的改进;(2)在测试时缩放中从候选响应中选择最佳响应;(3)从现有的图像和视频指令微调训练数据中过滤离群或噪声样本。为确保可复现性并促进进一步研究,我们已在https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-Reward开源了所有模型权重和训练方案。
引用
@article{arxiv.2501.12368,
title = {InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model},
author = {Yuhang Zang and Xiaoyi Dong and Pan Zhang and Yuhang Cao and Ziyu Liu and Shengyuan Ding and Shenxi Wu and Yubo Ma and Haodong Duan and Wenwei Zhang and Kai Chen and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2501.12368},
year = {2025}
}
备注
ACL 2025 Findings