稳定偏见:扩散模型中社会表征的分析
计算机与社会
2023-11-13 v2
摘要
随着机器学习赋能的文本到图像(TTI)系统日益普及并作为商业服务获得越来越多采用,刻画其所表现的社会偏见是降低其歧视性后果风险的必要第一步。然而,由于这些系统输出的合成性质,该评估变得更加困难:多样性的常见定义立足于世界中真实人群的社会类别,而这些系统所生成虚构人类的人工描绘并无固有的性别或族裔。为满足此需求,我们提出了一种探索TTI系统中社会偏见的新方法。我们的方法依赖于通过枚举提示中的性别与族裔标记来刻画生成图像的变化,并将其与跨越不同职业所引发的变化进行比较。这使我们能够(1)识别特定偏见趋势,(2)提供针对性分数以直接比较模型在多样性与代表性方面的表现,以及(3)联合建模相互依赖的社会变量以支持多维分析。我们利用该方法分析了3个流行TTI系统(Dall-E 2、Stable Diffusion v 1.4与2)生成的图像,发现尽管它们的输出均与美国劳动力人口统计相关,但也一致地在不同程度上低估了边缘化身份。我们还发布了为此工作开发的数据集与低代码交互式偏见探索平台,以及用于类似评估其他TTI系统的必要工具。
引用
@article{arxiv.2303.11408,
title = {Stable Bias: Analyzing Societal Representations in Diffusion Models},
author = {Alexandra Sasha Luccioni and Christopher Akiki and Margaret Mitchell and Yacine Jernite},
journal= {arXiv preprint arXiv:2303.11408},
year = {2023}
}
备注
Accepted to NeurIPS Datasets and Benchmarks 2023 (spotlight)