中文

FTGAN:一种用于文本到人脸生成的全训练生成对抗网络

计算机视觉与模式识别 2019-04-12 v1

摘要

作为文本到图像合成的子领域,文本到人脸生成在公共安全领域具有巨大潜力。由于缺乏数据集,目前几乎没有专注于文本到人脸合成的相关研究。本文提出了一种全训练生成对抗网络(FTGAN),该网络同时训练文本编码器和图像解码器,以实现细粒度的文本到人脸生成。借助新颖的全训练生成网络,FTGAN 能够合成更高质量的图像,并促使输出结果与输入句子更具相关性。此外,我们构建了一个名为 SCU-Text2face 的文本到人脸合成数据集。通过大量实验,FTGAN 展现了其在提升生成图像质量及与输入描述相似度方面的优越性。所提出的 FTGAN 优于先前最先进的方法,在 CUB 数据集上将最佳报告 Inception Score 提升至 4.63。在 SCU-text2face 上,仅基于输入描述由我们提出的 FTGAN 生成的人脸图像与真实值的平均相似度达到 59%,为文本到人脸合成设定了基线。

关键词

引用

@article{arxiv.1904.05729,
  title  = {FTGAN: A Fully-trained Generative Adversarial Networks for Text to Face Generation},
  author = {Xiang Chen and Lingbo Qing and Xiaohai He and Xiaodong Luo and Yining Xu},
  journal= {arXiv preprint arXiv:1904.05729},
  year   = {2019}
}