中文

通过混合偏好优化增强多模态大语言模型的推理能力

计算与语言 2025-04-08 v2 计算机视觉与模式识别

摘要

现有的开源多模态大语言模型(MLLMs)通常遵循涉及预训练和监督微调的训练过程。然而,这些模型遭受分布偏移,限制了其多模态推理,特别是在思维链(CoT)性能方面。为解决此问题,我们引入偏好优化(PO)过程以增强MLLMs的多模态推理能力。具体而言,(1)在数据方面,我们设计了一个自动化偏好数据构建流程,创建了MMPR,一个高质量、大规模的多模态推理偏好数据集;(2)在模型方面,我们探索将PO与MLLMs相结合,开发了一种简单而有效的方法,称为混合偏好优化(MPO),提升了多模态CoT性能。我们的方法增强了InternVL2-8B和InternVL2-76B的多模态推理能力。值得注意的是,我们的模型InternVL2-8B-MPO在MathVista上达到了67.0的准确率,比InternVL2-8B高出8.7分,性能与大10倍的InternVL2-76B相当。我们希望这项研究能激发MLLMs的进一步进步。代码、数据和模型已发布。

关键词

引用

@article{arxiv.2411.10442,
  title  = {Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization},
  author = {Weiyun Wang and Zhe Chen and Wenhai Wang and Yue Cao and Yangzhou Liu and Zhangwei Gao and Jinguo Zhu and Xizhou Zhu and Lewei Lu and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2411.10442},
  year   = {2025}
}