视觉语言模型对表现为黑人的个体生成更均质的叙事
计算机视觉与模式识别
2025-03-21 v2
摘要
视觉语言模型(VLMs)通过整合图像处理能力扩展了大语言模型的功能,但关于其潜在放大人类偏见的担忧仍然存在。虽然已有研究记录了这些模型如何在不同族裔群体之间延续刻板印象,但大多数工作关注的是跨群体偏见,而非同一族群内部的差异。本研究探讨了同质性偏见——即将群体描绘得比实际更统一的倾向——在美国黑人群体中的表现,考察了感知族裔特征如何影响VLMs的输出。我们使用系统性变换表现为黑人的计算机生成图像,并引导VLMs生成这些个体的故事,测量文本相似度以评估内容同质性。我们的发现揭示了三个关键模式:首先,VLMs在表现为黑人且族裔特征更高的个体身上,生成的故事显著更为均质;其次,关于黑人女性的故事在所有模型中均显示出更大的同质性;最后,在两个模型中,这种同质性偏见主要由一种显著的交互作用驱动,即族裔特征对黑人女性内容变异性产生强烈影响,但对黑人男性影响甚微。这一结果表明,交叉性如何塑造AI生成的表征,突显了与人类感知中已记录偏见相符的刻板化现象:族裔特征越高,刻板化越严重,个体化表征越少。
引用
@article{arxiv.2412.09668,
title = {Vision-Language Models Generate More Homogeneous Stories for Phenotypically Black Individuals},
author = {Messi H. J. Lee and Soyeon Jeon},
journal= {arXiv preprint arXiv:2412.09668},
year = {2025}
}