中文

基于全景布局生成的交互式图像合成

计算机视觉与模式识别 2022-03-29 v3

摘要

当用户希望轻松控制生成图像的场景结构时,基于用户引导输入的交互式图像合成是一项具有挑战性的任务。尽管基于布局的图像合成方法已取得显著进展,但为了在交互式场景中生成逼真的伪造图像,现有方法需要高精度输入,这可能需要多次调整且对 novice 用户不友好。当边界框的放置受到扰动时,基于布局的模型在构建的语义布局中会出现“缺失区域”,从而导致生成图像中出现不良伪影。在本工作中,我们提出全景布局生成对抗网络(Panoptic Layout Generative Adversarial Networks, PLGAN)以应对这一挑战。PLGAN 采用全景理论,将物体类别区分为具有模糊边界的“stuff”与具有明确形状的“things”,从而通过独立分支构建 stuff 与实例布局,随后融合为全景布局。特别地,stuff 布局可取模糊形状并填补实例布局遗留的缺失区域。我们在 COCO-Stuff、Visual Genome 和 Landscape 数据集上实验比较了 PLGAN 与最先进的基于布局的模型。PLGAN 的优势不仅在视觉上得到展示,还在 inception score、Fréchet inception distance、classification accuracy score 和 coverage 方面得到定量验证。

关键词

引用

@article{arxiv.2203.02104,
  title  = {Interactive Image Synthesis with Panoptic Layout Generation},
  author = {Bo Wang and Tao Wu and Minfeng Zhu and Peng Du},
  journal= {arXiv preprint arXiv:2203.02104},
  year   = {2022}
}

备注

Accepted by CVPR 2022