中文

视觉语言模型中面孔的社会感知

计算机视觉与模式识别 2025-09-16 v2 人工智能 计算机与社会 机器学习

摘要

我们探讨了 CLIP(一个广泛使用的开源视觉语言模型)中人脸社会感知。为此,我们比较了 CLIP 中不同文本提示与一组人脸图像之间的相似度。我们的文本提示由经过充分验证的社会心理学术语构成,用以表示社会感知。人脸图像为合成图像,沿六个维度系统且独立地进行变换:年龄、性别和种族(受法律保护的属性),以及面部表情、光照和姿态。独立且系统地操控人脸属性允许我们研究每个属性对社会感知的影响,避免了野生数据中由于控制不当导致的属性之间系统性相关性造成的混淆。因此,我们的发现是实验性的而非观察性的。我们的主要发现有三点:首先,尽管 CLIP 在图像和文本上训练的数据覆盖范围最广,它仍能对人脸图像进行细粒度的人类化社会判断。其二,年龄、性别和种族确实会系统性地影响 CLIP 对人脸的社会感知,这表明 CLIP 在受法律保护属性方面存在不希望的偏见。最令人震惊的是,我们发现黑人女性的脸面会产生极端的社会感知值,在不同年龄和面部表情下均表现如此。其三,面部表情对社会感知的影响大于年龄和光照,同样大于年龄。最后一发现表明,若未控制受保护的视觉属性,可能得出关于偏见的错误结论。我们新颖的调查方法基于社会心理学文献,并涉及对单个属性操控的实验,比以往的观察方法更具尖锐性和可靠性,可用于研究任何视觉语言模型中的偏见。

关键词

引用

@article{arxiv.2408.14435,
  title  = {Social Perception of Faces in a Vision-Language Model},
  author = {Carina I. Hausladen and Manuel Knott and Colin F. Camerer and Pietro Perona},
  journal= {arXiv preprint arXiv:2408.14435},
  year   = {2025}
}