更显著的黑人和女性面孔会导致视觉语言模型中的刻板印象增加
计算机视觉与模式识别
2024-11-25 v2 人工智能
计算与语言
摘要
视觉语言模型 (VLMs),以 GPT-4V 为代表,擅长集成文本和视觉模态。这种集成增强了大型语言模型的仿人感知能力,使其能够处理图像输入。尽管 VLMs 拥有先进的能力,但我们担心 VLMs 以一种更难以缓解的方式继承了两种模态的偏见。我们的研究探讨了 VLMs 关于种族和性别的均匀性偏见以及特征关联问题。当被要求根据人脸图像编写故事时,GPT-4V 对从属种族和性别群体的描述比主导群体更具均匀性,并且依赖于distinct yet generally positive的刻板印象。重要的是,VLMs 的刻板印象是由视觉线索驱动的,而不仅仅是由群体成员资格决定的,以致于被评估为更具代表性的黑人和女性面孔会遭受更大的刻板印象。这些发现表明,VLMs 可能将与种族和性别群体相关的细微视觉线索与刻板印象联系起来,这在缓解方面可能具有挑战性。我们探讨了这种行为背后的原因,并讨论了其影响及意义,强调在 VLMs 模拟人类感知的过程中必须注意这些偏见。
引用
@article{arxiv.2407.06194,
title = {More Distinctively Black and Feminine Faces Lead to Increased Stereotyping in Vision-Language Models},
author = {Messi H. J. Lee and Jacob M. Montgomery and Calvin K. Lai},
journal= {arXiv preprint arXiv:2407.06194},
year = {2024}
}
备注
This submission is being withdrawn to address concerns related to the terms of use of a database utilized in the research. We aim to ensure full compliance with all data usage agreements before proceeding with publication