中文

GABInsight:探索视觉语言模型中的性别-活动绑定偏差

计算机视觉与模式识别 2024-10-28 v3 人工智能 机器学习

摘要

视觉语言模型(VLMs)在众多下游任务中被广泛使用,包括需要对图像中出现的个体进行评估的任务。虽然VLMs在简单单人场景中表现良好,但在现实应用中常面临多个性别个体进行不同活动的复杂情形。我们发现,在此类情况下,VLMs倾向于识别出根据模型中内嵌性别刻板印象或其他形式的样本选择偏差所期望的性别个体作为活动执行者。我们将将活动与其实际执行者在图像或文本中性别关联的偏差称为性别-活动绑定(Gender-Activity Binding, GAB)偏差,并分析其在VLMs中的内化方式。为评估此偏差,我们引入了包含约5500个AI生成图像的GAB数据集,代表各种活动情形,旨在解决现有图像稀缺问题。为确保广泛质量控制,对生成图像进行多样性、质量和真实性评估。我们在该数据集上测试了12个著名预训练VLMs,以文本到图像和图像到文本检索语境中的偏差效果。此外,我们进行了补充实验来量化VLMs文本编码器中的偏差,并评估VLMs识别活动的能力。实验表明,VLMs在面对性别-活动绑定偏差时平均性能下降约13.2%。

关键词

引用

@article{arxiv.2407.21001,
  title  = {GABInsight: Exploring Gender-Activity Binding Bias in Vision-Language Models},
  author = {Ali Abdollahi and Mahdi Ghaznavi and Mohammad Reza Karimi Nejad and Arash Mari Oriyad and Reza Abbasi and Ali Salesi and Melika Behjati and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2407.21001},
  year   = {2024}
}