中文

MM-SpuBench:更好地理解多模态 LLM 中的虚假偏置

计算机视觉与模式识别 2026-01-01 v2 机器学习

摘要

虚假偏置是一种倾向于利用输入表面属性与预测目标之间的虚假关联的趋势,这在经典机器学习问题中暴露出严重的鲁棒性差距。多模态大型语言模型 (MLLM) 利用预训练的视觉和语言模型,最近在联合视觉语言理解方面展现出强大的能力。然而,MLLM 中虚假偏置的存在和严重程度仍不为人知。本文通过分析多模态环境中的虚假偏置并揭示具体推理时数据模式中可显现此问题的特定模式来弥补这一差距。为支持此分析,我们引入 MM-SpuBench,一个全面且经人工验证的基准数据集,包含由核心属性和虚假属性标注的图像-类别对,基于我们对九种不同类型虚假关联的分类法。该基准数据集使用人类可解释属性信息构建,以捕捉反映真实世界知识的广泛范围的虚假模式。利用该基准,我们对最新开源和专有 MLLM 进行全面评估,包括标准准确率和提出的条件生成概率优势 (CGLA)。我们的发现突显了对虚假关联依赖的持久性以及在本基准上缓解其困难性。我们希望本工作能够激发新的技术步伐来缓解这些偏置。我们的基准数据集已在 https://huggingface.co/datasets/mmbench/MM-SpuBench 上公开。

关键词

引用

@article{arxiv.2406.17126,
  title  = {MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs},
  author = {Wenqian Ye and Bohan Liu and Guangtao Zheng and Di Wang and Yunsheng Ma and Xu Cao and Bolin Lai and James M. Rehg and Aidong Zhang},
  journal= {arXiv preprint arXiv:2406.17126},
  year   = {2026}
}

备注

Accepted at KDD 2026 (Dataset and Benchmark Track)