TediGAN:基于文本引导的多样化人脸图像生成与编辑
计算机视觉与模式识别
2021-03-30 v3 人工智能
多媒体
摘要
本文中,我们提出 TediGAN,一种基于文本描述的多模态图像生成与编辑新框架。所提方法由三个组件构成:StyleGAN 反演模块、视觉-语言相似性学习,以及实例级优化。反演模块将真实图像映射到训练良好的 StyleGAN 的潜空间。视觉-语言相似性通过将图像与文本映射至公共嵌入空间来学习文本-图像匹配。实例级优化用于在编辑中保持身份。我们的模型能以 1024 的空前分辨率生成多样化高质量图像。利用基于风格混合的控制机制,我们的 TediGAN 天然支持带有或不带实例引导的多模态输入(如草图或语义标签)的图像合成。为促进文本引导的多模态合成,我们提出 Multi-Modal CelebA-HQ,一个由真实人脸图像及相应语义分割图、草图与文本描述组成的大规模数据集。在引入的数据集上的大量实验证明了我们所提方法的优越性能。代码与数据见 https://github.com/weihaox/TediGAN。
引用
@article{arxiv.2012.03308,
title = {TediGAN: Text-Guided Diverse Face Image Generation and Manipulation},
author = {Weihao Xia and Yujiu Yang and Jing-Hao Xue and Baoyuan Wu},
journal= {arXiv preprint arXiv:2012.03308},
year = {2021}
}
备注
CVPR 2021. Code: https://github.com/weihaox/TediGAN Data: https://github.com/weihaox/Multi-Modal-CelebA-HQ Video: https://youtu.be/L8Na2f5viAM