中文

MIGC:面向文本到图像合成的多实例生成控制器

计算机视觉与模式识别 2024-02-28 v2

摘要

我们提出了一个多实例生成(MIG)任务,即在一张图像中同时生成具有多样化控制的多个实例。给定一组预定义的坐标及其对应的描述,该任务旨在确保生成的实例精确位于指定位置,并且所有实例的属性都符合其对应的描述。这将当前单实例生成的研究范围拓宽,提升到一个更通用、更实用的维度。受分而治之思想的启发,我们引入了一种名为多实例生成控制器(MIGC)的创新方法,以应对 MIG 任务的挑战。首先,我们将 MIG 任务分解为多个子任务,每个子任务涉及对单个实例的着色。为确保每个实例的精确着色,我们引入了一种实例增强注意力机制。最后,我们聚合所有着色后的实例,为在稳定扩散(SD)中精确生成多个实例提供必要信息。为了评估生成模型在 MIG 任务上的表现,我们提供了一个 COCO-MIG 基准以及一个评估流程。我们在提出的 COCO-MIG 基准以及各种常用基准上进行了大量实验。评估结果展示了我们的模型在数量、位置、属性和交互方面卓越的控制能力。代码和演示将在 https://migcproject.github.io/ 发布。

关键词

引用

@article{arxiv.2402.05408,
  title  = {MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis},
  author = {Dewei Zhou and You Li and Fan Ma and Xiaoting Zhang and Yi Yang},
  journal= {arXiv preprint arXiv:2402.05408},
  year   = {2024}
}

备注

Accepted for publication in CVPR 2024