中文

多属性与结构化的文本到人脸合成

计算机视觉与模式识别 2021-10-12 v1 机器学习 图像与视频处理

摘要

生成对抗网络通过人脸生成、照片编辑和图像超分辨率等众多应用彻底改变了图像合成领域。使用 GAN 的图像合成主要是单模态的,很少有方法可以从文本或其他数据模态合成图像。文本到图像合成,尤其是文本到人脸合成,在根据目击者描述生成鲁棒的人脸以及通过视觉线索增强阅读体验方面具有广阔的应用前景。然而,只有少数几个数据集为文本到人脸合成提供了整合的人脸数据和文本描述。此外,这些文本标注不够详尽且缺乏描述性,这降低了由此生成的人脸的多样性。本文从经验上证明了,增加每个文本描述中的面部属性数量有助于 GAN 生成更多样且更逼真的人脸。为了证明这一点,我们提出了一种专注于使用结构化文本描述的新方法。我们还整合了一个多属性与结构化文本到人脸数据集,包含带有结构化文本标注的高质量图像,并将其提供给研究人员进行实验和改进。最后,我们报告了 MAST 数据集的基准 Frechet Inception Distance (FID)、面部语义相似度 和面部语义距离 得分。

关键词

引用

@article{arxiv.2108.11100,
  title  = {Multi-Attributed and Structured Text-to-Face Synthesis},
  author = {Rohan Wadhawan and Tanuj Drall and Shubham Singh and Shampa Chakraverty},
  journal= {arXiv preprint arXiv:2108.11100},
  year   = {2021}
}

备注

Accepted by IEEE TEMSMET 2020, Camera Ready Version