用于可控图像到图像翻译的统一生成对抗网络
计算机视觉与模式识别
2020-10-28 v2 机器学习
图像与视频处理
摘要
我们提出一种统一的生成对抗网络(GAN)用于可控图像到图像翻译,即,在可控结构引导下将图像从源域迁移至目标域。除以参考图像为条件外,我们展示了模型如何生成以可控结构为条件的图像,例如类标签、物体关键点、人体骨架与场景语义图。所提模型由单一生成器与判别器组成,以条件图像与目标可控结构为输入。如此,条件图像可提供外观信息,而可控结构可提供用于生成目标结果的结构信息。此外,我们的模型通过三种新损失学习图像到图像映射,即颜色损失、可控结构引导循环一致性损失与可控结构引导自内容保持损失。同时,我们提出 Fréchet ResNet Distance (FRD) 以评估生成图像的质量。在两个具挑战性的图像翻译任务(即手势到手势翻译与跨视角图像翻译)上的实验表明,我们的模型生成令人信服的结果,并在两项任务上显著优于其他最先进方法。同时,所提框架为统一解,故可应用于解决其他可控结构引导图像翻译任务,如关键点引导人脸表情翻译与关键点引导人体图像生成。据我们所知,我们首个使单一 GAN 框架在所有此类可控结构引导图像翻译任务上生效。代码见 https://github.com/Ha0Tang/GestureGAN。
引用
@article{arxiv.1912.06112,
title = {Unified Generative Adversarial Networks for Controllable Image-to-Image Translation},
author = {Hao Tang and Hong Liu and Nicu Sebe},
journal= {arXiv preprint arXiv:1912.06112},
year = {2020}
}
备注
Accepted to TIP, an extended version of a paper published in ACM MM 2018. arXiv admin note: substantial text overlap with arXiv:1808.04859