中文

识别视觉语言模型中的隐式社会偏见

计算机视觉与模式识别 2024-11-05 v1 人工智能 计算与语言 计算机与社会

摘要

视觉语言模型,如 CLIP (Contrastive Language Image Pretraining),正变得越来越受欢迎,用于各种多模态检索任务。然而,先前的研究表明,大型语言模型和深度视觉模型会学习其训练集中包含的历史偏见,从而导致刻板印象的延续及潜在的下游伤害。本文对 CLIP 中存在的社会偏见进行系统性分析,特别关注图像和文本模态之间的相互作用。我们首先提出了称为 So-B-IT 的社会偏见分类法,其中包含 374 个单词,跨越十种偏见类型。每种类型都可能导致关联特定人口统计学群体的社会伤害。使用该分类法,我们检查了 CLIP 从人脸图像数据集中检索到的图像,每一种单词都作为提示的一部分。我们发现,CLIP经常显示出有害单词与特定人口统计学群体之间的不寻常关联,例如,当被询问检索“恐怖分子”时,常检索出大多数为中东男性的图片。最后,我们通过展示相同有害刻板印象也存在于用于训练 CLIP 模型的大型图像-文本数据集中,来分析此类偏见的来源。我们的发现突显了在视觉语言模型中评估和解决偏见的重要性,并提示需要在大型预训练数据集中实现透明度和公平性。

关键词

引用

@article{arxiv.2411.00997,
  title  = {Identifying Implicit Social Biases in Vision-Language Models},
  author = {Kimia Hamidieh and Haoran Zhang and Walter Gerych and Thomas Hartvigsen and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2411.00997},
  year   = {2024}
}