中文

文本到图像模型中差异表示的发现

计算机视觉与模式识别 2025-09-12 v1

摘要

本文研究了两个不同的生成模型所学的视觉表示何时以及如何产生分歧。给定两个文本到图像模型,我们的目标是发现在一个模型生成的图像中出现但在另一个模型中未出现的视觉属性,以及触发这些属性差异的提示类型。例如,'火焰'可能在一个模型对表达强烈情感的提示的输出中出现,而另一个模型在相同提示下并不产生该属性。我们提出了CompCon(比较概念),一种进化搜索算法,用于发现一个模型输出中比另一个模型更普遍的视觉属性,并揭示与这些视觉差异相关的提示概念。为了评估CompCon发现差异表示的能力,我们创建了一个自动数据生成流水线来生成ID2,一个包含60个输入依赖差异的数据集,并将我们的方法与几种基于大语言模型和视觉语言模型的基线方法进行了比较。最后,我们使用CompCon来比较流行的文本到图像模型,发现了差异表示,例如PixArt如何在提及孤独的提示中描绘湿漉漉的街道,而Stable Diffusion 3.5如何在媒体职业中描绘非裔美国人。代码地址:https://github.com/adobe-research/CompCon

关键词

引用

@article{arxiv.2509.08940,
  title  = {Discovering Divergent Representations between Text-to-Image Models},
  author = {Lisa Dunlap and Joseph E. Gonzalez and Trevor Darrell and Fabian Caba Heilbron and Josef Sivic and Bryan Russell},
  journal= {arXiv preprint arXiv:2509.08940},
  year   = {2025}
}

备注

Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon