一图胜千言:文本到图像生成中感知变异性的度量与理解
计算机视觉与模式识别
2024-11-27 v2 计算与语言
摘要
扩散模型是文本到图像生成领域的最新技术,但其感知变异性仍未得到充分研究。本文探讨了提示词如何影响黑盒扩散模型中的图像变异性。我们提出了W1KP,一种基于人类校准的图像集变异性度量方法,该方法从现有的图像对感知距离中自举得到。当前数据集未涵盖最近的扩散模型,因此我们策划了三个测试集用于评估。我们最佳的感知距离在准确率上比九种基线方法高出最多18个百分点,其校准结果在78%的情况下与分级人类判断一致。利用W1KP,我们研究了提示词的可重用性,并表明Imagen的提示词在10-50个随机种子内可重用,之后新图像与已生成图像过于相似,而Stable Diffusion XL和DALL-E 3可重用50-200次。最后,我们分析了真实提示词的56个语言特征,发现提示词长度、CLIP嵌入范数、具体性和词义对变异性的影响最大。据我们所知,我们是首个从视觉语言学角度分析扩散变异性的工作。我们的项目页面位于http://w1kp.com。
引用
@article{arxiv.2406.08482,
title = {Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation},
author = {Raphael Tang and Xinyu Zhang and Lixinyu Xu and Yao Lu and Wenyan Li and Pontus Stenetorp and Jimmy Lin and Ferhan Ture},
journal= {arXiv preprint arXiv:2406.08482},
year = {2024}
}
备注
Published at EMNLP 2024; outstanding paper award; 14 pages, 11 figures