视觉语言模型中性别与种族视觉线索与刻板印象的关联
计算机视觉与模式识别
2025-03-10 v1
摘要
当前关于视觉语言模型(VLM)中偏见的研究存在重要局限:研究仅聚焦于特质关联而忽略了其他形式的刻板印象,考察的是偏见预期出现的特定语境,并且将种族和性别等社会类别视为二元,忽略了这些身份的多元性。利用在原型性上有所变化的标准面部图像,我们测试了四种 VLM 在开放语境中的特质关联和同质性偏见。我们发现,与男性相比,VLM 一致地为女性生成更统一的故事,外表性别原型性更强的人被更统一地呈现。相比之下,VLM 对白人美国人的呈现比黑人美国人更统一。与性别原型性不同,种族原型性与更强的统一性无关。在特质关联方面,我们发现了有限的刻板印象证据——在所有模型中,黑人美国人都始终与篮球相关联,而其他种族关联(即艺术、医疗保健、外貌)则因具体 VLM 而异。这些发现表明,VLM 刻板印象以超越简单群体归属的方式表现出来,暗示传统的偏见缓解策略可能不足以应对 VLM 刻板印象,并且即使在模型输出中特质关联不太明显时,同质性偏见仍然存在。
引用
@article{arxiv.2503.05093,
title = {Visual Cues of Gender and Race are Associated with Stereotyping in Vision-Language Models},
author = {Messi H. J. Lee and Soyeon Jeon and Jacob M. Montgomery and Calvin K. Lai},
journal= {arXiv preprint arXiv:2503.05093},
year = {2025}
}