中文

StyleCLIP:基于文本驱动的 StyleGAN 图像操控

计算机视觉与模式识别 2021-04-01 v1 计算与语言 图形学 机器学习

摘要

受 StyleGAN 能够在多种域中生成高度逼真图像能力的启发,近期许多工作聚焦于如何利用 StyleGAN 的潜空间来操控生成图像与真实图像。然而,发现具有语义意义的潜空间操控通常需费力地人工检视众多自由度,或为每个所需操控准备带标注的图像集合。在本工作中,我们探索利用近期提出的对比语言-图像预训练(CLIP)模型的威力,以开发一种基于文本的 StyleGAN 图像操控接口,其无需此类人工投入。我们首先引入一种优化方案,利用基于 CLIP 的损失根据用户提供的文本提示修改输入潜向量。接着,我们描述一个潜映射器,其为给定输入图像推断文本引导的潜操控步长,从而实现更快速、更稳定的基于文本操控。最后,我们提出一种将文本提示映射到 StyleGAN 风格空间中与输入无关方向的方法,支持交互式文本驱动图像操控。大量结果与比较证明了我们方法的有效性。

关键词

引用

@article{arxiv.2103.17249,
  title  = {StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery},
  author = {Or Patashnik and Zongze Wu and Eli Shechtman and Daniel Cohen-Or and Dani Lischinski},
  journal= {arXiv preprint arXiv:2103.17249},
  year   = {2021}
}

备注

18 pages, 24 figures, code and video may be found here: https://github.com/orpatashnik/StyleCLIP