以风格编码:用于图像到图像翻译的StyleGAN编码器
计算机视觉与模式识别
2021-04-22 v2
摘要
我们提出了一个通用的图像到图像翻译框架,pixel2style2pixel(pSp)。我们的pSp框架基于一种新颖的编码器网络,该网络直接生成一系列风格向量,并输入到预训练的StyleGAN生成器中,形成扩展的W+潜空间。我们首先表明,我们的编码器可以直接将真实图像嵌入W+,无需额外优化。接下来,我们提出利用我们的编码器直接解决图像到图像翻译任务,将其定义为从某些输入域到潜域的编码问题。通过偏离先前StyleGAN编码器使用的标准先反演后编辑方法,我们的方法可以处理各种任务,即使输入图像未在StyleGAN域中表示。我们表明,通过StyleGAN解决翻译任务显著简化了训练过程,因为不需要对抗器,更好地支持解决无像素到像素对应关系的任务,并且通过风格重采样固有地支持多模态合成。最后,我们在各种人脸图像到图像翻译任务上展示了我们框架的潜力,即使与专为单一任务设计的最先进(SOTA)解决方案相比,并进一步表明它可以扩展到人类人脸域之外。
引用
@article{arxiv.2008.00951,
title = {Encoding in Style: a StyleGAN Encoder for Image-to-Image Translation},
author = {Elad Richardson and Yuval Alaluf and Or Patashnik and Yotam Nitzan and Yaniv Azar and Stav Shapiro and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2008.00951},
year = {2021}
}
备注
Accepted to CVPR 2021, project page available at https://eladrich.github.io/pixel2style2pixel/