中文

学习用于可控图像合成的布局与风格可重配置 GANs

计算机视觉与模式识别 2021-03-30 v2

摘要

随着深度生成模型学习的最新显著进展,开发用于从可重配置输入进行可控图像合成的模型变得日益有趣。本文聚焦于一个近期出现的任务,布局到图像,以学习能够从空间布局(即配置在图像栅格中的目标边界框)和风格(即由潜向量编码的结构和外观变化)合成照片级真实图像的生成模型。本文首先为该任务提出一个直观范式,布局到掩码到图像,学习将输入布局中给定边界框的目标掩码展开,以弥合输入布局与合成图像之间的差距。然后,本文提出一种基于生成对抗网络(GANs)的方法,用于所提出的布局到掩码到图像,并在图像和掩码两级进行风格控制。目标掩码从输入布局中学习并在生成器网络的各阶段迭代细化。图像级的风格控制与原始 GANs 相同,而目标掩码级的风格控制通过一种提出的新型特征归一化方案——实例敏感与布局感知归一化实现。在实验中,所提方法在 COCO-Stuff 数据集和 Visual Genome 数据集上进行了测试,并取得了最先进的性能。

关键词

引用

@article{arxiv.2003.11571,
  title  = {Learning Layout and Style Reconfigurable GANs for Controllable Image Synthesis},
  author = {Wei Sun and Tianfu Wu},
  journal= {arXiv preprint arXiv:2003.11571},
  year   = {2021}
}

备注

16 pages (w/o ref), 15 figures)