中文

Generative RLHF-V:从多模态人类偏好中学习原理

人工智能 2025-05-27 v1 计算机视觉与模式识别

摘要

训练能够与人类意图一致的多模态大语言模型 (MLLMs) 是长期挑战。传统的仅评分奖励模型在准确性、泛化性和可解释性方面存在不足,阻碍了对齐方法的进步,如强化学习从人类反馈 (RLHF)。生成式奖励模型 (GRMs) 利用 MLLMs 的内在推理能力进行成对响应的判别,但其成对范式使得难以学习可训练奖励。我们引入 Generative RLHF-V,一种新型对齐框架,将 GRMs 与多模态 RLHF 集成。我们提出两个阶段的管道:textbf多模态生成式奖励建模从RL\\textbf{多模态生成式奖励建模从 RL},其中 RL 指导 GRMs 主动捕获人类意图,然后预测正确的成对得分;textbf从分组比较中进行RL优化\\textbf{从分组比较中进行 RL 优化},通过分组响应比较提高多模态 RL 评分精度。实验结果表明,我们的方法在 RM 判别的分布外泛化方面优于基线,同时使 4 个 MLLMs 在 7 个基准测试上的性能提升 18.1%18.1\%,而基线 RLHF 仅提升 5.3%5.3\%。我们进一步验证,Generative RLHF-V 在候选响应数量增加时可实现近线性提升。我们的代码和模型可在 https://generative-rlhf-v.github.io 访问。

关键词

引用

@article{arxiv.2505.18531,
  title  = {Generative RLHF-V: Learning Principles from Multi-modal Human Preference},
  author = {Jiayi Zhou and Jiaming Ji and Boyuan Chen and Jiapeng Sun and Wenqi Chen and Donghai Hong and Sirui Han and Yike Guo and Yaodong Yang},
  journal= {arXiv preprint arXiv:2505.18531},
  year   = {2025}
}

备注

9 pages, 8 figures