SocialCounterfactuals:使用反事实示例探测和缓解视觉语言模型中的交叉社会偏见
计算机视觉与模式识别
2024-04-11 v2 人工智能
摘要
尽管视觉语言模型(VLM)最近取得了显著的性能提升,但越来越多的证据表明,这些模型在性别和种族等社会属性方面也存在有害偏见。先前的研究主要集中于单独探测这些偏见属性,而忽略了与社会属性交叉相关的偏见。这可能是由于难以收集针对各种社会属性组合的详尽图像-文本对集。为了应对这一挑战,我们利用文本到图像扩散模型大规模生成反事实示例,用于探测交叉社会偏见。我们的方法利用带有交叉注意力控制的Stable Diffusion,生成一组反事实图像-文本对,这些对在描绘主体(例如,给定职业)方面高度相似,仅在交叉社会属性(例如,种族和性别)的描绘上有所不同。通过我们的“过度生成-然后过滤”方法,我们生成了SocialCounterfactuals,这是一个高质量的数据集,包含171k个图像-文本对,用于探测与性别、种族和身体特征相关的交叉偏见。我们进行了大量实验,证明了我们生成的数据集在探测和缓解最先进VLM中的交叉社会偏见方面的有用性。
引用
@article{arxiv.2312.00825,
title = {SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples},
author = {Phillip Howard and Avinash Madasu and Tiep Le and Gustavo Lujan Moreno and Anahita Bhiwandiwalla and Vasudev Lal},
journal= {arXiv preprint arXiv:2312.00825},
year = {2024}
}
备注
Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988