多样性与扩散:关于 Stable Diffusion 合成图像分布的观察
计算机视觉与模式识别
2023-11-02 v1 人工智能
机器学习
摘要
近期文本到图像 (TTI) 系统(如 StableDiffusion、Imagen 与 DALL-E 2)的进展,使得用简单文本提示创建逼真图像成为可能。人们很想利用这些系统来消除为新机器学习分类器获取自然图像的手动任务。然而,在迄今进行的所有实验中,仅用合成图像训练的分类器在推理时表现不佳,尽管用于训练的图像看似逼真。详细审视这一明显矛盾可深入认识底层图像生成过程的局限。通过图像创建多样性与所创建内容准确性的视角,我们剖析合成图像与自然图像在建模内容上的语义错配差异。这将阐明图像-语言模型 CLIP 与图像生成模型扩散的作用。我们发现限制 TTI 系统用于该任务的四个问题:歧义、对提示的遵循不足、缺乏多样性,以及无法表示底层概念。我们进一步对 CLIP 嵌入的几何结构提出了令人惊讶的见解。
引用
@article{arxiv.2311.00056,
title = {Diversity and Diffusion: Observations on Synthetic Image Distributions with Stable Diffusion},
author = {David Marwood and Shumeet Baluja and Yair Alon},
journal= {arXiv preprint arXiv:2311.00056},
year = {2023}
}