中文

面向文本到图像扩散模型的零样本空间布局条件控制

计算机视觉与模式识别 2023-06-27 v1

摘要

大规模文本到图像扩散模型已显著推进了生成式图像建模的技术水平,并提供了一种直观且强大的用户界面来驱动图像生成过程。使用文本来表达空间约束(例如将特定对象放置在特定位置)是繁琐的,且当前基于文本的图像生成模型无法准确遵循此类指令。在本文中,我们考虑从与图像画布上分割区域相关联的文本生成图像,这结合了直观的自然语言界面与对生成内容的精确空间控制。我们提出 ZestGuide,一种零样本分割引导方法,可插入预训练的文本到图像扩散模型中,且不需要任何额外训练。它利用可从交叉注意力层提取的隐式分割图,并用它们将生成过程与输入掩码对齐。我们的实验结果在保持高图像质量的同时,实现了生成内容与输入分割的准确对齐,并在定量和定性上均优于先前的工作,包括那些需要在带对应分割的图像上训练的方法。与 Paint with Words(此前零样本分割条件图像生成的最优方法)相比,我们在 COCO 数据集上以相近的 FID 分数将 mIoU 提升了 5 到 10 个点。

关键词

引用

@article{arxiv.2306.13754,
  title  = {Zero-shot spatial layout conditioning for text-to-image diffusion models},
  author = {Guillaume Couairon and Marlène Careil and Matthieu Cord and Stéphane Lathuilière and Jakob Verbeek},
  journal= {arXiv preprint arXiv:2306.13754},
  year   = {2023}
}