中文

以风格编码:用于图像到图像翻译的StyleGAN编码器

计算机视觉与模式识别 2021-04-22 v2

摘要

我们提出了一个通用的图像到图像翻译框架,pixel2style2pixel(pSp)。我们的pSp框架基于一种新颖的编码器网络,该网络直接生成一系列风格向量,并输入到预训练的StyleGAN生成器中,形成扩展的W+潜空间。我们首先表明,我们的编码器可以直接将真实图像嵌入W+,无需额外优化。接下来,我们提出利用我们的编码器直接解决图像到图像翻译任务,将其定义为从某些输入域到潜域的编码问题。通过偏离先前StyleGAN编码器使用的标准先反演后编辑方法,我们的方法可以处理各种任务,即使输入图像未在StyleGAN域中表示。我们表明,通过StyleGAN解决翻译任务显著简化了训练过程,因为不需要对抗器,更好地支持解决无像素到像素对应关系的任务,并且通过风格重采样固有地支持多模态合成。最后,我们在各种人脸图像到图像翻译任务上展示了我们框架的潜力,即使与专为单一任务设计的最先进(SOTA)解决方案相比,并进一步表明它可以扩展到人类人脸域之外。

关键词

引用

@article{arxiv.2008.00951,
  title  = {Encoding in Style: a StyleGAN Encoder for Image-to-Image Translation},
  author = {Elad Richardson and Yuval Alaluf and Or Patashnik and Yotam Nitzan and Yaniv Azar and Stav Shapiro and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2008.00951},
  year   = {2021}
}

备注

Accepted to CVPR 2021, project page available at https://eladrich.github.io/pixel2style2pixel/