中文

释放文本到图像扩散模型中的空间理解能力

计算机视觉与模式识别 2023-12-01 v1

摘要

我们提出 CompFuser,一种增强文本到图像生成模型中空间理解与属性分配的图像生成流水线。我们的流水线能够解释定义场景中物体间空间关系的指令,例如“一张灰色猫在橙色狗左边的图像”,并生成相应图像。这对于向用户提供更多控制尤为重要。CompFuser 通过将多个物体的生成解码为迭代步骤,克服了现有文本到图像扩散模型的局限:首先生成单个物体,然后通过将其余物体放置于指定位置来编辑图像。为创建用于空间理解与属性合成的训练数据,我们引入了利用冻结大语言模型与冻结基于布局的扩散模型进行物体放置的合成数据生成过程。我们将方法与强基线比较,表明尽管参数规模小 3 至 5 倍,我们的模型在空间理解与属性分配上优于最先进的图像生成模型。

关键词

引用

@article{arxiv.2311.17937,
  title  = {Unlocking Spatial Comprehension in Text-to-Image Diffusion Models},
  author = {Mohammad Mahdi Derakhshani and Menglin Xia and Harkirat Behl and Cees G. M. Snoek and Victor Rühle},
  journal= {arXiv preprint arXiv:2311.17937},
  year   = {2023}
}