中文

Text2FaceGAN:基于细粒度文本描述的人脸生成

机器学习 2019-11-27 v1 计算机视觉与模式识别 多媒体 图像与视频处理 机器学习

摘要

强大的生成对抗网络(GAN)已被开发用于从文本自动合成逼真图像。然而,大多数现有任务局限于从描述生成如花朵之类的简单图像。在本工作中,我们将该问题拓展至较少被涉及的领域:从人脸的细粒度文本描述生成人脸,例如“一个人有卷发、椭圆脸和胡须”。我们的动机在于自动化人脸生成对刑事人脸重建等关键任务的潜在助力。由于当前该任务的数据集要么规模很小,要么不含描述文本,我们通过设计算法将属性列表自动转换为一组描述,从而为CelebA数据集中的图像生成描述。随后,我们将文本到人脸生成这一高度多模态问题建模为在同一潜空间中学习人脸(以文本为条件)的条件分布。我们利用当前最先进的GAN(带GAN-CLS损失的DC-GAN)来学习条件多模态。相比其他文本到图像任务,描述中更细粒度的细节与可变长度使得该问题对用户更易使用,但更难处理。我们对真实与生成图像的标签进行翻转,并在判别器中加入噪声。针对多样化文本描述生成的图像展现出令人鼓舞的结果。最后,我们展示了被广泛使用的inception score并非评估从文本合成人脸的生成模型性能的良好指标。

关键词

引用

@article{arxiv.1911.11378,
  title  = {Text2FaceGAN: Face Generation from Fine Grained Textual Descriptions},
  author = {Osaid Rehman Nasir and Shailesh Kumar Jha and Manraj Singh Grover and Yi Yu and Ajit Kumar and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:1911.11378},
  year   = {2019}
}