中文

ContraCLIP:由成对对比语句驱动的具有可解释性的GAN生成

计算机视觉与模式识别 2022-06-07 v1

摘要

本工作以与模型无关的方式解决在预训练GAN的潜空间中发掘非线性可解释路径的问题。在所提方法中,该发掘过程由一组具有对比语义的自然语言句子对驱动,称为语义偶极子,它们作为我们要求可训练潜路径所编码的解释的边界。通过使用预训练的CLIP编码器,这些句子被投影到视觉-语言空间中,在其中它们作为偶极子,并且基于RBF的扭曲函数定义了一组非线性方向路径,每个语义偶极子对应一条,从而允许从一个语义极遍历到另一个语义极。通过定义一个在GAN潜空间中发现路径的目标,这些路径在视觉-语言嵌入空间中沿期望路径生成变化,我们提供了一种控制底层生成因素的直观方式,并解决了现有最优工作的若干局限,即:a) 它们通常针对特定GAN架构(即StyleGAN)定制;b) 它们忽视了被操纵图像与原始图像在图像嵌入中的相对位置以及图像与文本嵌入的相对位置;c) 它们导致突兀的图像操纵并迅速到达低密度区域,从而图像质量低,对生成因素的控制有限。我们提供了广泛的定性与定量结果,用两个预训练GAN证明了我们的主张,并在 https://github.com/chi0tzp/ContraCLIP 公开了代码与预训练模型。

关键词

引用

@article{arxiv.2206.02104,
  title  = {ContraCLIP: Interpretable GAN generation driven by pairs of contrasting sentences},
  author = {Christos Tzelepis and James Oldfield and Georgios Tzimiropoulos and Ioannis Patras},
  journal= {arXiv preprint arXiv:2206.02104},
  year   = {2022}
}