中文

文本到图像合成中语义相关性的对抗学习

计算机视觉与模式识别 2019-02-07 v2 计算与语言 机器学习

摘要

我们描述了一种新方法,改进了生成对抗网络 (GANs) 从文本输入合成多样图像的训练。我们的方法基于条件版 GANs,并扩展了先前在判别器中利用辅助任务的工作。我们生成的图像不限于某些类别,并且在语义上匹配文本输入的同时不受模式崩溃影响。我们训练方法的一个关键是如何针对给定图像的类别标签形成正训练和负训练样本。我们不选择随机训练样本,而是基于与正样本在类别中的语义距离进行负采样。我们使用 Oxford-102 花卉数据集评估我们的方法,采用 inception score 和多尺度结构相似性指数 (MS-SSIM) 指标来评估生成图像的可判别性和多样性。实证结果表明生成图像具有更大的多样性,尤其是当我们在语义空间中逐步选择更接近正样本的负训练样本时。

关键词

引用

@article{arxiv.1812.05083,
  title  = {Adversarial Learning of Semantic Relevance in Text to Image Synthesis},
  author = {Miriam Cha and Youngjune L. Gwon and H. T. Kung},
  journal= {arXiv preprint arXiv:1812.05083},
  year   = {2019}
}