中文

文本到图像模型中地理差异的分解评估

计算机视觉与模式识别 2024-06-19 v1 人工智能 计算机与社会 机器学习

摘要

最近的研究识别出生成图像中不同地理区域存在显著差异,包括对日常物品如房屋和汽车等的刻板化表现。然而,现有的差异度量方法要么是人工评估,费时费钱;要么是评估完整图像的自动度量,无法将这些差异归因于生成图像的特定部分。本文引入了一组新的度量指标,称为分解的地理差异指示器 (Decomposed-DIG),允许我们单独测量对象和背景在生成图像中的地理差异。使用 Decomposed-DIG,我们审计了一个广泛使用的潜在扩散模型,发现生成的图像在对象真实性方面优于背景,且生成图像中的背景比对象包含更大的区域差异。我们利用 Decomposed-DIG 识别了具体的差异示例,例如非洲背景的刻板化生成、非洲现代车辆生成困难以及某些对象不切实际地置于户外环境中的情况。根据我们的度量,我们使用一种新的提示结构,实现了最坏地区的 52% 改进和平均 20% 的背景多样性提升。

关键词

引用

@article{arxiv.2406.11988,
  title  = {Decomposed evaluations of geographic disparities in text-to-image models},
  author = {Abhishek Sureddy and Dishant Padalia and Nandhinee Periyakaruppa and Oindrila Saha and Adina Williams and Adriana Romero-Soriano and Megan Richards and Polina Kirichenko and Melissa Hall},
  journal= {arXiv preprint arXiv:2406.11988},
  year   = {2024}
}