中文

CLIP2GAN:桥接文本与 GAN 隐空间

计算机视觉与模式识别 2022-11-29 v1

摘要

在这项工作中,我们致力于文本引导的图像生成,并利用 CLIP 模型和 StyleGAN 提出了一个新颖的框架,即 CLIP2GAN。CLIP2GAN 的核心思想是桥接 CLIP 的输出特征嵌入空间与 StyleGAN 的输入隐空间,这通过引入一个映射网络来实现。在训练阶段,我们用 CLIP 对图像进行编码,并将输出特征映射到一个隐编码,该隐编码随后被用于重建图像。通过这种方式,映射网络以自监督学习的方式进行优化。在推理阶段,由于 CLIP 可以将图像和文本嵌入到共享的特征嵌入空间中,我们用 CLIP 文本编码器替换训练架构中的 CLIP 图像编码器,同时保留后续的映射网络以及 StyleGAN 模型。因此,我们可以灵活地输入文本描述来生成图像。此外,通过简单地将某个属性的映射文本特征添加到映射后的 CLIP 图像特征上,我们可以有效地编辑图像的该属性。大量实验证明,我们提出的 CLIP2GAN 与先前方法相比具有优越的性能。

关键词

引用

@article{arxiv.2211.15045,
  title  = {CLIP2GAN: Towards Bridging Text with the Latent Space of GANs},
  author = {Yixuan Wang and Wengang Zhou and Jianmin Bao and Weilun Wang and Li Li and Houqiang Li},
  journal= {arXiv preprint arXiv:2211.15045},
  year   = {2022}
}