中文

OmniAlign-V:增强多模态大语言模型与人类偏好的一致性

计算机视觉与模式识别 2025-03-04 v2

摘要

近期开源多模态大语言模型(MLLM)的进展主要集中在增强基础能力上,在人类偏好对齐方面留下了显著空白。本文介绍了 OmniAlign-V,一个包含 20 万个高质量训练样本的综合数据集,具有多样化的图像、复杂的问题和多样的回答格式,旨在提高 MLLM 与人类偏好的一致性。我们还提出了 MM-AlignBench,一个专门设计用于评估 MLLM 与人类价值观对齐程度的人工标注基准。实验结果表明,使用 OmniAlign-V 对 MLLM 进行微调,无论是通过监督微调(SFT)还是直接偏好优化(DPO),都能显著增强人类偏好对齐,同时保持或增强标准 VQA 基准上的性能,从而保留其基本能力。我们的数据集、基准、代码和检查点已在 https://github.com/PhoenixZ810/OmniAlign-V 发布。

关键词

引用

@article{arxiv.2502.18411,
  title  = {OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference},
  author = {Xiangyu Zhao and Shengyuan Ding and Zicheng Zhang and Haian Huang and Maosong Cao and Weiyun Wang and Jiaqi Wang and Xinyu Fang and Wenhai Wang and Guangtao Zhai and Haodong Duan and Hua Yang and Kai Chen},
  journal= {arXiv preprint arXiv:2502.18411},
  year   = {2025}
}