MIGC:面向文本到图像合成的多实例生成控制器
计算机视觉与模式识别
2024-02-28 v2
摘要
我们提出了一个多实例生成(MIG)任务,即在一张图像中同时生成具有多样化控制的多个实例。给定一组预定义的坐标及其对应的描述,该任务旨在确保生成的实例精确位于指定位置,并且所有实例的属性都符合其对应的描述。这将当前单实例生成的研究范围拓宽,提升到一个更通用、更实用的维度。受分而治之思想的启发,我们引入了一种名为多实例生成控制器(MIGC)的创新方法,以应对 MIG 任务的挑战。首先,我们将 MIG 任务分解为多个子任务,每个子任务涉及对单个实例的着色。为确保每个实例的精确着色,我们引入了一种实例增强注意力机制。最后,我们聚合所有着色后的实例,为在稳定扩散(SD)中精确生成多个实例提供必要信息。为了评估生成模型在 MIG 任务上的表现,我们提供了一个 COCO-MIG 基准以及一个评估流程。我们在提出的 COCO-MIG 基准以及各种常用基准上进行了大量实验。评估结果展示了我们的模型在数量、位置、属性和交互方面卓越的控制能力。代码和演示将在 https://migcproject.github.io/ 发布。
引用
@article{arxiv.2402.05408,
title = {MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis},
author = {Dewei Zhou and You Li and Fan Ma and Xiaoting Zhang and Yi Yang},
journal= {arXiv preprint arXiv:2402.05408},
year = {2024}
}
备注
Accepted for publication in CVPR 2024