中文

用于分析文生图模型偏见的词级解释

计算与语言 2023-06-12 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

文生图模型接收一句话(即提示)并生成与该输入提示相关的图像。这些模型已创作出获奖艺术、视频乃至合成数据集。然而,文生图(T2I)模型可能生成基于种族和性别低估少数群体的图像。本文研究输入提示中哪个词导致了生成图像中的偏见。我们引入一种为提示中每个词计算分数的方法;这些分数代表其对模型输出中偏见的影响。我们的方法遵循“通过移除进行解释”的原则,利用掩码语言模型计算影响分数。我们在Stable Diffusion上开展实验,证明本方法可识别生成图像中社会刻板印象的复现。

关键词

引用

@article{arxiv.2306.05500,
  title  = {Word-Level Explanations for Analyzing Bias in Text-to-Image Models},
  author = {Alexander Lin and Lucas Monteiro Paes and Sree Harsha Tanneru and Suraj Srinivas and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2306.05500},
  year   = {2023}
}

备注

5 main pages, 3 pages in appendix, and 3 figures