基于 StyleGAN2 的文本到人脸生成
计算机视觉与模式识别
2022-05-26 v1
摘要
随着生成对抗网络的出现,从文本描述合成图像已成为一个活跃的研究领域。其主要目标是生成与输入描述对齐的照片级真实感图像。文本到人脸生成(T2F)是文本到图像生成(T2I)的一个子领域,由于面部属性的复杂性与多变性而更具挑战性。它在公共安全领域有若干应用。尽管已有若干 T2F 模型,仍亟需提升图像质量与语义对齐。在本研究中,我们提出一种新颖框架,以生成与输入描述良好对齐的人脸图像。我们的框架利用高分辨率人脸生成器 StyleGAN2,并探索其在 T2F 中的使用可能性。此处,我们使用 BERT 嵌入将文本嵌入 StyleGAN2 的输入潜空间,并依据文本描述监督人脸图像生成。我们在基于属性的描述上训练框架,生成分辨率为 1024x1024 的图像。生成图像与真实图像表现出 57% 的相似度,人脸语义距离为 0.92,优于当前最优工作。生成图像的 FID 分数为 118.097,实验结果表明我们的模型生成了有前景的图像。
引用
@article{arxiv.2205.12512,
title = {Text-to-Face Generation with StyleGAN2},
author = {D. M. A. Ayanthi and Sarasi Munasinghe},
journal= {arXiv preprint arXiv:2205.12512},
year = {2022}
}
备注
16 pages, 5 figures, for conference, https://aircconline.com/csit/papers/vol12/csit120805.pdf