检查文本到图像模型生成图像的地理代表性
计算机视觉与模式识别
2023-05-19 v1 计算与语言
摘要
生成模型的最新进展使得模型能为大多数文本输入生成逼真且相关的图像。这些模型每天被用于生成数百万张图像,并有可能极大地影响生成艺术、数字营销和数据增强等领域。鉴于其巨大影响,确保生成内容反映全球各地的物品与环境,而非过度代表世界某些地区,十分重要。在本文中,我们通过一项涵盖27个国家540名参与者的众包研究,衡量了通过DALL.E 2和Stable Diffusion模型生成的常见名词(如房屋)的地理代表性。对于无意指定国家名的输入,生成图像最能反映美国的环境,其次是印度,而排名靠前的生成结果很少反映所有其他国家的环境(平均得分低于5分中的3分)。在输入中指定国家名使DALL.E 2的代表性平均提高1.44分,Stable Diffusion提高0.75分,然而许多国家的总体得分仍然较低,突显了未来模型需要更具地理包容性。最后,我们考察了在不进行用户研究的情况下量化生成图像地理代表性的可行性。
引用
@article{arxiv.2305.11080,
title = {Inspecting the Geographical Representativeness of Images from Text-to-Image Models},
author = {Abhipsa Basu and R. Venkatesh Babu and Danish Pruthi},
journal= {arXiv preprint arXiv:2305.11080},
year = {2023}
}
备注
Preprint, 15 pages, 9 figures