中文

CLIP是实现稳定扩散中类人语义表征的关键

计算机视觉与模式识别 2025-11-12 v1 人工智能

摘要

潜在扩散模型如Stable Diffusion在文本到图像生成任务中取得了最新进展。然而,这些模型在生成图像时是否具有对图像语义的理解尚不明确。本文我们探讨这些模型在文本到图像生成过程中使用的内部表示是否包含对人类有意义的语义信息。为此,我们对Stable Diffusion进行探针测试,使用简单的回归层预测语义属性并用人类标注进行评估。令人惊讶的是,我们发现这种成功实际上归功于CLIP中发生的文本编码,而非反向扩散过程。我们展示,特定语义属性的组在解码准确率上显著不同于平均值,因此被表示得程度不同。最后,我们表明在逆扩散过程中,属性之间的辨别变得更加困难,进一步证明了CLIP中对对象属性的最强语义表征。我们得出结论,独立训练的CLIP视觉语言模型决定了类人语义表征,而扩散过程则发挥视觉解码器的作用。

关键词

引用

@article{arxiv.2511.08075,
  title  = {CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion},
  author = {Cameron Braunstein and Mariya Toneva and Eddy Ilg},
  journal= {arXiv preprint arXiv:2511.08075},
  year   = {2025}
}

备注

28 pages, 8 figures, 2 tables