中文

StyleGAN-NADA:基于 CLIP 引导的图像生成器域适应

计算机视觉与模式识别 2021-12-17 v2 计算与语言 图形学 机器学习

摘要

能否在仅由文本提示引导、且未见过任何图像的情况下,训练生成模型产出特定域的图像?换言之:图像生成器能否被“盲目”训练?利用大规模对比语言-图像预训练(CLIP)模型的语义能力,我们提出一种文本驱动方法,可在无需收集哪怕单张图像的情况下,将生成模型迁移至新域。我们展示通过自然语言提示与几分钟的训练,我们的方法能将生成器适配至以多样风格与形状为特征的众多域。值得注意的是,其中许多修改用现有方法难以甚至根本无法达成。我们在广泛域上进行了大量实验与对比。这些证明了我们方法的有效性,并表明我们迁移后的模型保持了使生成模型对下游任务具吸引力的潜空间性质。

关键词

引用

@article{arxiv.2108.00946,
  title  = {StyleGAN-NADA: CLIP-Guided Domain Adaptation of Image Generators},
  author = {Rinon Gal and Or Patashnik and Haggai Maron and Gal Chechik and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2108.00946},
  year   = {2021}
}

备注

Project page: https://stylegan-nada.github.io/