基于拼贴表示的可控图像生成
计算机视觉与模式识别
2023-04-27 v1
摘要
条件生成图像模型的最新进展已实现了令人印象深刻的结果。一方面,基于文本的条件模型通过利用大规模图文对数据集,达到了卓越的生成质量。然而,为实现细粒度可控性,基于文本的模型需要冗长提示,其细节可能被模型忽略。另一方面,基于布局的条件模型也取得了显著进展。这些模型依赖边界框或分割图进行精确空间条件化,并结合粗粒度语义标签。但语义标签无法表达细致的外观特征。本文中,我们通过图像拼贴来实现细粒度场景可控性,其允许对期望场景以及其中物体的外观和位置进行丰富视觉描述,而无需类别或属性标签。我们提出“混合匹配场景”(M&Ms),一种对抗训练的生成图像模型,其以拼贴中不同元素的外观特征和空间位置为条件,并将它们整合为连贯图像。我们在 OpenImages (OI) 数据集上训练模型,并在源自 OI 和 MS-COCO 数据集的拼贴上评估。我们在 OI 数据集上的实验表明,M&Ms 在细粒度场景可控性上优于基线,同时在图像质量和样本多样性上极具竞争力。在 MS-COCO 数据集上,我们突出了模型的泛化能力:尽管参数和数据少两个数量级,其在零样本 FID 指标上优于 DALL-E。基于拼贴的生成模型有潜力以高效且有效的方式推进内容创作,因为它们直观易用且能产出高质量生成结果。
引用
@article{arxiv.2304.13722,
title = {Controllable Image Generation via Collage Representations},
author = {Arantxa Casanova and Marlène Careil and Adriana Romero-Soriano and Christopher J. Pal and Jakob Verbeek and Michal Drozdzal},
journal= {arXiv preprint arXiv:2304.13722},
year = {2023}
}