中文

VLBiasBench:评估大型视觉语言模型偏差的全面基准

计算机视觉与模式识别 2026-04-07 v3 人工智能

摘要

大型视觉语言模型 (LVLMs) 的出现标志着通用人工智能取得了重要进展。然而,这些进步伴随着偏见输出方面的顾虑,这一挑战尚未得到充分探索。现有基准在数据规模、提问格式和偏见来源方面不够全面。为此,我们提出 VLBiasBench,一个用于评估 LVLMs 偏差的全面基准。VLBiasBench 的数据集覆盖九类社会偏见,包括年龄、残疾状态、性别、国籍、外貌、种族、宗教、职业、社会经济地位,以及两个交叉性偏见类别:种族×性别和种族×社会经济地位。为构建大规模数据集,我们使用 Stable Diffusion XL 模型生成 46,848 张高质量图片,并与各种问题组合,创建 128,342 个样本。这些问题分为开放式和封闭式类型,确保全面考虑偏见来源,对 LVLMs 的偏差进行多维度评估。我们在 15 个开源模型以及两个高级闭源模型上进行了广泛评估,揭示了这些模型中存在的偏见。我们的基准已公开于 https://github.com/Xiangkui-Cao/VLBiasBench。

关键词

引用

@article{arxiv.2406.14194,
  title  = {VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model},
  author = {Sibo Wang and Xiangkui Cao and Jie Zhang and Zheng Yuan and Shiguang Shan and Xilin Chen and Wen Gao},
  journal= {arXiv preprint arXiv:2406.14194},
  year   = {2026}
}

备注

Accepted By TPAMI