中文

SCRAMBLe:通过合成偏好数据提升多模态 LLM 的组合性

计算机视觉与模式识别 2025-09-30 v2 人工智能

摘要

组合性——即正确识别场景作为原子视觉概念的组合——仍是多模态大型语言模型(MLLMs)的难题。即便是像GPT-4o这样的领先 MLLMs 在区分"狗追猫"与"猫追狗"等组合时也会出错。在Winoground这一衡量此类推理的基准上,MLLMs虽已取得显著进展,但仍远不及人类的水平。我们表明,通过阐明这些概念来改善这些模型的组合推理是可能的,即模型被训练去优先选择图像的正确标题而非接近但错误的标题。我们引入SCRAMBLe:Synthetic Compositional Reasoning Augmentation of MLLMs with Binary preference Learning,即一种针对 MLLMs 的合成组合推理数据生成的二元偏好学习方法。SCRAMBLe整体性地提升了这些 MLLMs的组合推理能力,这种提升在多个视觉语言组合性基准上显著显现,以及在更一般的问答任务上也有显著但较小的提升。作为预览,SCRAMBLe调谐后的 Molmo-7B 模型在Winoground 上提升至54.8%(迄今为止最佳报告值),同时在更一般的视觉问答任务上提升约1%。SCRAMBLe的代码、调谎模型以及我们的合成训练数据集均已在 https://github.com/samarth4149/SCRAMBLe 上提供。

关键词

引用

@article{arxiv.2504.04740,
  title  = {SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data},
  author = {Samarth Mishra and Kate Saenko and Venkatesh Saligrama},
  journal= {arXiv preprint arXiv:2504.04740},
  year   = {2025}
}

备注

ICCV 2025 Findings