Generative RLHF-V:从多模态人类偏好中学习原理
人工智能
2025-05-27 v1 计算机视觉与模式识别
摘要
训练能够与人类意图一致的多模态大语言模型 (MLLMs) 是长期挑战。传统的仅评分奖励模型在准确性、泛化性和可解释性方面存在不足,阻碍了对齐方法的进步,如强化学习从人类反馈 (RLHF)。生成式奖励模型 (GRMs) 利用 MLLMs 的内在推理能力进行成对响应的判别,但其成对范式使得难以学习可训练奖励。我们引入 Generative RLHF-V,一种新型对齐框架,将 GRMs 与多模态 RLHF 集成。我们提出两个阶段的管道:,其中 RL 指导 GRMs 主动捕获人类意图,然后预测正确的成对得分;,通过分组响应比较提高多模态 RL 评分精度。实验结果表明,我们的方法在 RM 判别的分布外泛化方面优于基线,同时使 4 个 MLLMs 在 7 个基准测试上的性能提升 ,而基线 RLHF 仅提升 。我们进一步验证,Generative RLHF-V 在候选响应数量增加时可实现近线性提升。我们的代码和模型可在 https://generative-rlhf-v.github.io 访问。
引用
@article{arxiv.2505.18531,
title = {Generative RLHF-V: Learning Principles from Multi-modal Human Preference},
author = {Jiayi Zhou and Jiaming Ji and Boyuan Chen and Jiapeng Sun and Wenqi Chen and Donghai Hong and Sirui Han and Yike Guo and Yaodong Yang},
journal= {arXiv preprint arXiv:2505.18531},
year = {2025}
}
备注
9 pages, 8 figures