面向开放世界文本引导的人脸图像生成与编辑
计算机视觉与模式识别
2021-04-20 v1 多媒体
摘要
现有文本引导图像合成方法只能产生有限质量的结果,最高分辨率为\mbox{},且文本指令受限于小规模语料库。本工作中,我们提出一个统一的框架,用于人脸图像生成与编辑,可从多模态输入产生多样且高质量、分辨率前所未有的1024的图像。更重要的是,我们的方法支持开放世界场景,包括图像与文本,无需任何重新训练、微调或后处理。具体而言,我们基于预训练GAN模型的优越特性,提出一种全新的文本引导图像生成与编辑范式。我们提出的范式包含两种新策略。第一种策略是训练一个文本编码器,以获得与上述预训练GAN模型的层次化语义相对齐的潜码。第二种策略是在预训练GAN模型的潜空间中,借助预训练语言模型的引导直接优化潜码。潜码可从先验分布随机采样或由市给定图像反演得到,这为来自多模态输入(如草图或语义标签)并带文本引导的图像生成与编辑提供了内在支持。为促进文本引导多模态合成,我们提出Multi-Modal CelebA-HQ,一个由真实人脸图像及相应语义分割图、草图与文本描述组成的大规模数据集。在引入数据集上的大量实验证明了我们所提方法的优越性能。代码与数据见https://github.com/weihaox/TediGAN。
引用
@article{arxiv.2104.08910,
title = {Towards Open-World Text-Guided Face Image Generation and Manipulation},
author = {Weihao Xia and Yujiu Yang and Jing-Hao Xue and Baoyuan Wu},
journal= {arXiv preprint arXiv:2104.08910},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2012.03308