中文

为多物体生成获取有利布局

计算机视觉与模式识别 2024-05-03 v1 人工智能

摘要

能够根据文本提示生成高质量和多样化图像的大规模文本到图像模型已取得显著成功。这些模型的最终目标是创建复杂场景,而解决多主体生成挑战是实现这一目标的关键步骤。然而,现有的 SOTA 扩散模型在生成涉及多个主体的图像时面临困难。当面对包含多个主体的提示时,这些模型可能会遗漏某些主体或将它们合并在一起。为了应对这一挑战,我们提出了一种基于指导原则的新方法。我们允许扩散模型首先提出一个布局,然后我们重新排列布局网格。这是通过强制交叉注意力图(XAMs)遵循所提出的掩码,并将像素从潜在图迁移到由我们确定的新位置来实现的。我们引入了新的损失项,旨在降低 XAM 熵以获得更清晰的空间定义,减少 XAMs 之间的重叠,并确保 XAMs 与其各自的掩码对齐。我们将我们的方法与几种替代方法进行了对比,并表明它在各种文本提示下能更忠实地捕捉所需概念。

关键词

引用

@article{arxiv.2405.00791,
  title  = {Obtaining Favorable Layouts for Multiple Object Generation},
  author = {Barak Battash and Amit Rozner and Lior Wolf and Ofir Lindenbaum},
  journal= {arXiv preprint arXiv:2405.00791},
  year   = {2024}
}