中文

MEBench:一种理解视觉语言模型中互斥性偏置的新颖基准

计算机视觉与模式识别 2026-04-17 v2

摘要

本文介绍了 MEBench,一种用于评估互斥性(ME)偏置的新颖基准,ME 偏置是在儿童词汇学习期间观察到的一种认知现象。与传统的 ME 任务不同,MEBench 进一步结合了空间推理,以创建更具挑战性和现实性的评估设置。为了便于进行受控实验,我们还提出了一种灵活且可扩展的数据生成流水线,支持构建多样化的标注场景。我们使用能够捕捉基于 ME 推理关键方面的新颖评估指标,在此基准上评估了各种视觉语言模型(VLM)的性能。我们发现这些 VLM 表现出较弱的 ME 偏置,同时显示出一定的利用额外空间上下文来解决多个新颖物体设置中歧义的能力。项目页面:http://mebench.github.io/。

关键词

引用

@article{arxiv.2505.20122,
  title  = {MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models},
  author = {Anh Thai and Stefan Stojanov and Zixuan Huang and Bikram Boote and James M. Rehg},
  journal= {arXiv preprint arXiv:2505.20122},
  year   = {2026}
}