中文

MM-RLHF:多模态 LLM 对齐的下一步

计算与语言 2025-02-17 v1 计算机视觉与模式识别

摘要

尽管多模态大型语言模型(MLLMs)取得了显著进展,但大多数最先进的模型尚未经过充分对齐以符合人类偏好。这一差距存在的原因是当前对齐研究主要在特定领域取得进展(例如减少幻觉),而将模型与人类偏好对齐是否能够系统性地提高 MLLM 能力这一更广泛问题仍鲜有探索。为此,我们引入了 MM-RLHF,一个包含 120k\mathbf{120k} 个细粒度、人工标注的偏好比较对。该数据集在规模、多样性、标注细粒度和质量方面均优于现有资源。利用该数据集,我们提出了若干关键创新来提高奖励模型的质量和对齐算法的效率。值得注意的是,我们引入了批判性奖励模型(Critique-Based Reward Model),该模型在赋予分数之前会生成模型输出的批评,相较于传统标量奖励机制,提供了更好的可解释性和更有信息量的反馈。此外,我们提出了动态奖励比例(Dynamic Reward Scaling)方法,根据奖励信号调整每个样本的损失权重,从而优化高质量比较对的使用。我们在 10\mathbf{10} 个不同维度和 27\mathbf{27} 个基准上严格评估了该方法,结果显示模型性能在各方面都有显著且一致的改进。具体而言,使用我们的方法和对齐算法对 LLaVA-ov-7B 进行微调,使其对话能力提升 19.5\mathbf{19.5}%,安全性提升 60\mathbf{60}%。我们已开源偏好数据集、奖励模型、训练和评估代码,以及奖励建模和安全基准。欲了解更多详情,请访问我们的项目页面:https://mm-rlhf.github.io。

关键词

引用

@article{arxiv.2502.10391,
  title  = {MM-RLHF: The Next Step Forward in Multimodal LLM Alignment},
  author = {Yi-Fan Zhang and Tao Yu and Haochen Tian and Chaoyou Fu and Peiyan Li and Jianshu Zeng and Wulin Xie and Yang Shi and Huanyu Zhang and Junkang Wu and Xue Wang and Yibo Hu and Bin Wen and Fan Yang and Zhang Zhang and Tingting Gao and Di Zhang and Liang Wang and Rong Jin and Tieniu Tan},
  journal= {arXiv preprint arXiv:2502.10391},
  year   = {2025}
}

备注

Project Page: https://mm-rlhf.github.io/