中文

Faces à la Carte:通过属性解耦实现文本到人脸生成

计算机视觉与模式识别 2020-09-21 v2

摘要

文本到人脸(TTF)合成是一项具有挑战性的任务,在多种计算机视觉应用中具有巨大潜力。与文本到图像(TTI)合成任务相比,由于面部属性的多样性以及高维抽象自然语言的解析,人脸的文字描述可能更为复杂和详细。在本文中,我们提出了一种文本到人脸模型,该模型不仅能生成具有文本-图像一致性的高分辨率(1024x1024)图像,还能以自然的方式输出多个多样化的人脸,以覆盖广泛未指定的面部特征。通过微调多标签分类器和图像编码器,我们的模型获得了用于变换从正态分布采样的输入噪声向量的向量和图像嵌入。随后,变换后的噪声向量被馈入预训练的高分辨率图像生成器,以生成一组具有所需面部属性的人脸。我们将我们的模型称为 TTF-HD。实验结果表明,TTF-HD 生成了高质量的人脸,并达到了最先进的性能。

关键词

引用

@article{arxiv.2006.07606,
  title  = {Faces \`a la Carte: Text-to-Face Generation via Attribute Disentanglement},
  author = {Tianren Wang and Teng Zhang and Brian Lovell},
  journal= {arXiv preprint arXiv:2006.07606},
  year   = {2020}
}

备注

8 pages, 4 figures