中文

PasteGAN:一种从场景图生成图像的半参数化方法

计算机视觉与模式识别 2019-12-02 v2

摘要

尽管在从结构化(场景图)或自由形式(句子)描述生成高质量图像方面取得了一些令人振奋的进展,但大多数方法仅保证图像级别的语义一致性,即生成的图像与描述的语义含义相匹配。它们仍缺乏对以更可控方式合成图像的研究,例如精细操控每个物体的视觉外观。因此,为了生成具有偏好物体和丰富交互的图像,我们提出了一种半参数化方法 PasteGAN,用于从场景图和图像裁剪块生成图像,其中物体的空间排布及其成对关系由场景图定义,物体外观由给定的物体裁剪块决定。为了增强输出中物体的交互,我们设计了裁剪精炼网络(Crop Refining Network)和物体-图像融合器(Object-Image Fuser),将物体及其关系嵌入到一张特征图中。多个损失协同工作,以保证生成的图像高度尊重裁剪块并符合场景图,同时保持优异的图像质量。若未提供裁剪块,还提出了一种裁剪选择器(crop selector),通过编码场景图中物体周围的交互,从我们的外部物体库中挑选最兼容的裁剪块。在 Visual Genome 和 COCO-Stuff 数据集上评估,我们提出的方法在 Inception Score、Diversity Score 和 Fréchet Inception Distance 上显著优于 SOTA 方法。大量实验也证明了我们的方法在给定物体下生成复杂多样图像的能力。

关键词

引用

@article{arxiv.1905.01608,
  title  = {PasteGAN: A Semi-Parametric Method to Generate Image from Scene Graph},
  author = {Yikang Li and Tao Ma and Yeqi Bai and Nan Duan and Sining Wei and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1905.01608},
  year   = {2019}
}

备注

10 pages, 6 figures; Accepted by NeurIPS 2019