利用DALL-E 2揭示文本到图像生成中来自逼真森林的区域默认值
计算机与社会
2024-10-24 v1 计算机视觉与模式识别
机器学习
摘要
区域默认值描述了生成式AI中使用的文本到图像(T2I)基础模型倾向于过度描绘某些地理区域而排除其他区域的新兴现象。在这项工作中,我们引入了一种可扩展的评估方法来揭示此类区域默认值。该评估方法包括基于区域层次结构的图像生成和跨层次相似性比较。我们通过提示DALL-E 2(一种能够生成逼真图像的最先进的T2I生成模型)描绘一片森林来进行实验。我们选择森林作为一类显示区域变异并可以使用空间统计进行表征的对象。对于层次结构中的一个区域,我们的实验揭示了DALL-E 2中隐含的区域默认值,以及它们的尺度依赖性和空间关系。此外,我们发现隐含的默认值不一定对应于现实中森林最广泛的区域。我们的研究结果强调了进一步研究T2I生成和其他形式生成式AI地理学的必要性。
引用
@article{arxiv.2410.17255,
title = {Uncovering Regional Defaults from Photorealistic Forests in Text-to-Image Generation with DALL-E 2},
author = {Zilong Liu and Krzysztof Janowicz and Kitty Currier and Meilin Shi},
journal= {arXiv preprint arXiv:2410.17255},
year = {2024}
}
备注
Accepted by the 16th Conference on Spatial Information Theory (COSIT 2024): https://cosit.ca