中文

量化文本到图像生成模型中的偏差

计算机视觉与模式识别 2023-12-21 v1 密码学与安全

摘要

文本到图像(T2I)模型中的偏差会传播不公平的社会表征,并可能被用于激进地营销理念或推动有争议的议程。现有的 T2I 模型偏差评估方法仅关注社会偏差。我们超越于此,提出一种评估方法来量化 T2I 生成模型中的通用偏差,且不带任何先入之见。我们评估了四个最先进的 T2I 模型,并将其基线偏差特征与各自的变体(每个模型两个)进行比较,其中某些偏差已被故意引入。我们提出三个评估指标来评估模型偏差,包括: 分布偏差, Jaccard 幻觉,以及 生成漏检率。我们进行了两项评估研究,分别在通用条件和面向任务条件下对偏差进行建模,后者使用营销场景作为领域。我们还量化了社会偏差,以将我们的发现与相关工作进行比较。最后,我们的方法被迁移用于评估带标注图像数据集并测量其偏差。我们的方法是客观的、领域无关的,并且能够一致地测量各种形式的 T2I 模型偏差。我们开发了本文所提出内容的 Web 应用程序和实际实现,网址为 https://huggingface.co/spaces/JVice/try-before-you-bias。带有演示的视频系列可在 https://www.youtube.com/channel/UCk-0xyUyT0MSd_hkp4jQt1Q 获取。

关键词

引用

@article{arxiv.2312.13053,
  title  = {Quantifying Bias in Text-to-Image Generative Models},
  author = {Jordan Vice and Naveed Akhtar and Richard Hartley and Ajmal Mian},
  journal= {arXiv preprint arXiv:2312.13053},
  year   = {2023}
}

备注

main manuscript = 9 pages, 6 tables, 4 figures. Supplementary material = 15 pages, 13 tables, 14 figures