中文

StackGAN:基于堆叠生成对抗网络的文本到逼真图像合成

计算机视觉与模式识别 2017-08-08 v2 人工智能 机器学习

摘要

从文本描述合成高质量图像是计算机视觉中的一个挑战性问题,并具有许多实际应用。现有文本到图像方法生成的样本能够粗略反映给定描述的含义,但未能包含必要的细节和生动的目标部分。在本文中,我们提出了堆叠生成对抗网络(StackGAN),以生成以文本描述为条件的 256x256 逼真图像。我们通过草图-精炼过程将这一难题分解为更易处理的子问题。Stage-I GAN 根据给定的文本描述勾勒出目标的基本形状和颜色,生成 Stage-I 低分辨率图像。Stage-II GAN 将 Stage-I 的结果和文本描述作为输入,生成具有逼真细节的高分辨率图像。它能够通过精炼过程纠正 Stage-I 结果中的缺陷,并添加引人注目的细节。为了提高合成图像的多样性并稳定条件 GAN 的训练,我们引入了一种新颖的条件增强技术,该技术鼓励潜在条件流形中的平滑性。在基准数据集上的大量实验以及与 SOTA 方法的比较表明,所提方法在生成以文本描述为条件的逼真图像方面取得了显著改进。

关键词

引用

@article{arxiv.1612.03242,
  title  = {StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks},
  author = {Han Zhang and Tao Xu and Hongsheng Li and Shaoting Zhang and Xiaogang Wang and Xiaolei Huang and Dimitris Metaxas},
  journal= {arXiv preprint arXiv:1612.03242},
  year   = {2017}
}

备注

ICCV 2017 Oral Presentation