面向用户指定内容的条件图像生成与操控
计算机视觉与模式识别
2020-05-12 v1
摘要
近年来,生成对抗网络(GANs)稳步改进,生成出愈发逼真的真实世界图像。为内容创作等目的引导图像生成过程十分有用。这可以通过以额外信息为条件来实现。然而,在以额外信息为条件时,仍存在大量与特定条件相符的图像。这使得生成图像恰好如用户所设想的可能性很低,对于如生成人脸组合或素材照片等实际内容创作场景而言是有问题的。为解决该问题,我们提出一个用于文本到图像生成与操控的统一流水线。在流水线第一部分,我们引入 textStyleGAN,一个以文本为条件的模型。在流水线第二部分,我们利用 textStyleGAN 的预训练权重执行语义人脸图像操控。该方法通过寻找隐空间中的语义方向来实现。我们展示此方法可用于操控具有广泛属性的面部图像。最后,我们引入 CelebTD-HQ 数据集,作为 CelebA-HQ 的扩展,包含人脸及对应文本描述。
引用
@article{arxiv.2005.04909,
title = {Conditional Image Generation and Manipulation for User-Specified Content},
author = {David Stap and Maurits Bleeker and Sarah Ibrahimi and Maartje ter Hoeve},
journal= {arXiv preprint arXiv:2005.04909},
year = {2020}
}
备注
Accepted to the AI for content creation workshop at CVPR 2020