中文

透过文本到图像生成视角看社会偏见

计算机与社会 2023-04-14 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

文本到图像(T2I)生成正赋能新应用,通过从给定描述性文本作为提示生成具有高照片真实感的说明性内容,来支持生产力软件创作者、设计者和普通终端用户。然而,此类模型在海量网络数据上训练,暴露出生成过程本身可能泄露有害偏见的隐患。本文采用多维方法研究并量化生成图像中所反映的常见社会偏见,重点关注职业、人格特质和日常情境在(感知的)性别、年龄、种族和地理位置表征中的呈现方式。通过一组广泛的自动化与人工评估实验,我们给出了两个流行 T2I 模型 DALLE-2 和 Stable Diffusion 的发现。结果显示,中性提示存在严重的职业偏见,主要将部分人群排除在两种模型的结果之外。此类偏见可通过增加提示本身的指定程度来缓解,但提示缓解无法解决图像质量差异或模型在其他场景中的其他使用或表征问题。此外,我们观察到人格特质仅与种族、性别和年龄交叉下的有限人群相关联。最后,对日常情境(如公园、食物、婚礼)中地理位置表征的分析表明,对于大多数情境,通过默认位置中性提示生成的图像更接近且与为美国和德国位置生成的图像更相似。

关键词

引用

@article{arxiv.2304.06034,
  title  = {Social Biases through the Text-to-Image Generation Lens},
  author = {Ranjita Naik and Besmira Nushi},
  journal= {arXiv preprint arXiv:2304.06034},
  year   = {2023}
}