StyleCLIP:基于文本驱动的 StyleGAN 图像操控
计算机视觉与模式识别
2021-04-01 v1 计算与语言
图形学
机器学习
摘要
受 StyleGAN 能够在多种域中生成高度逼真图像能力的启发,近期许多工作聚焦于如何利用 StyleGAN 的潜空间来操控生成图像与真实图像。然而,发现具有语义意义的潜空间操控通常需费力地人工检视众多自由度,或为每个所需操控准备带标注的图像集合。在本工作中,我们探索利用近期提出的对比语言-图像预训练(CLIP)模型的威力,以开发一种基于文本的 StyleGAN 图像操控接口,其无需此类人工投入。我们首先引入一种优化方案,利用基于 CLIP 的损失根据用户提供的文本提示修改输入潜向量。接着,我们描述一个潜映射器,其为给定输入图像推断文本引导的潜操控步长,从而实现更快速、更稳定的基于文本操控。最后,我们提出一种将文本提示映射到 StyleGAN 风格空间中与输入无关方向的方法,支持交互式文本驱动图像操控。大量结果与比较证明了我们方法的有效性。
引用
@article{arxiv.2103.17249,
title = {StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery},
author = {Or Patashnik and Zongze Wu and Eli Shechtman and Daniel Cohen-Or and Dani Lischinski},
journal= {arXiv preprint arXiv:2103.17249},
year = {2021}
}
备注
18 pages, 24 figures, code and video may be found here: https://github.com/orpatashnik/StyleCLIP