基于生成对抗网络的图像文本合成
计算机视觉与模式识别
2018-05-03 v1 计算与语言
摘要
从自然语言生成图像是近期条件生成模型的主要应用之一。除了检验我们建模条件高维分布的能力外,文本到图像合成还有许多令人振奋且实用的应用,如照片编辑或计算机辅助内容创作。近期使用生成对抗网络(GANs)取得了进展。本文从对这些主题的温和介绍开始,并讨论现有最先进模型。此外,我提出 Wasserstein GAN-CLS,一种基于 Wasserstein 距离、提供稳定性保证的条件图像生成新模型。然后,我展示 Wasserstein GAN-CLS 的新损失函数如何用于条件渐进增长 GAN。结合所提损失,该模型在仅使用句子级视觉语义的模型中,将最佳 Inception Score(在 Caltech 鸟类数据集上)提升了 7.07%。唯一优于条件 Wasserstein 渐进增长 GAN 的模型是近期提出的、使用了词级视觉语义的 AttnGAN。
引用
@article{arxiv.1805.00676,
title = {Text to Image Synthesis Using Generative Adversarial Networks},
author = {Cristian Bodnar},
journal= {arXiv preprint arXiv:1805.00676},
year = {2018}
}