中文

BBQ-V:面向大型多模态模型的视觉刻板印象基准测试

计算机视觉与模式识别 2026-01-19 v3

摘要

大型多模态模型(LMM)中的刻板印象会延续有害社会偏见,削弱AI应用的公平性与平等性。随着LMM影响力的提升,针对刻板印象、有害生成及现实情境中模糊假设的内在偏见进行识别与缓解已 becoming 至关重要。然而,现有评估LMM刻板印象的数据集常缺乏多样性、依赖合成图像,且常仅包含单演员图像,导致现实情境下视觉偏见评估存在空白。为弥补基于真实图像的偏见评估空白,我们引入BBQ-Vision(BBQ-V),这是一套最全面的框架,覆盖九个多样化类别和50个子类别,包含真实且多演员的图像。BBQ-V基准包含14,144个图像-问题对,严格评估LMM在精心策划的视觉依托情境下的表现,挑战其准确推理视觉刻板印象。该基准提供了包括真实世界视觉样本、图像变体及开放式问题格式在内的稳健评估框架,使其能够在不同难度水平下精确细致地评估模型的推理能力。通过严格测试19个状态保持的开源(通用型与推理型)和封闭源LMM,我们指出这些顶尖模型在多个社交刻板印象上常常偏见,并展示思考模型在推理链中诱导更大偏见。该基准标志着推动AI系统公平性、减少有害偏见的重要一步,为构建更具公平性和社会责任感的LMM奠定了基础。我们的数据集和评估代码已公开。

关键词

引用

@article{arxiv.2502.08779,
  title  = {BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models},
  author = {Vishal Narnaware and Ashmal Vayani and Rohit Gupta and Sirnam Swetha and Mubarak Shah},
  journal= {arXiv preprint arXiv:2502.08779},
  year   = {2026}
}