CLIP2StyleGAN:StyleGAN 编辑方向的无监督提取
计算机视觉与模式识别
2021-12-13 v1 图形学
摘要
StyleGAN 的成功使得在合成图像和真实图像上均具备了前所未有的语义编辑能力。然而,此类编辑操作要么在语义监督下训练,要么借助人工引导来描述。在另一进展中,CLIP 架构已在互联网规模的图像与文本配对数据上完成训练,并被证明在多个零样本学习场景中十分有用。在本工作中,我们研究如何有效地连接 StyleGAN 与 CLIP 的预训练潜空间,这进而使我们能够自动从 StyleGAN 中提取带有语义标签的编辑方向,在无需任何额外人工引导的情况下发现并命名有意义的编辑操作。技术上,我们提出两个新颖的构建模块:一个用于寻找有趣的 CLIP 方向,另一个用于标注 CLIP 潜空间中的任意方向。该设置不假定任何预先确定的标签,因此我们构建编辑框架不需要任何额外的有监督文本/属性。我们评估了所提方法的有效性,并证明提取解耦的带标签 StyleGAN 编辑方向确实是可行的,且揭示了有趣且非平凡的编辑方向。
引用
@article{arxiv.2112.05219,
title = {CLIP2StyleGAN: Unsupervised Extraction of StyleGAN Edit Directions},
author = {Rameen Abdal and Peihao Zhu and John Femiani and Niloy J. Mitra and Peter Wonka},
journal= {arXiv preprint arXiv:2112.05219},
year = {2021}
}