中文

GANs N' Roses:稳定、可控、多样的图像到图像翻译(也适用于视频!)

计算机视觉与模式识别 2021-06-15 v1 图形学 机器学习

摘要

我们展示了如何学习一个映射,该映射将源自人脸图像的内容编码和随机选取的风格编码转换为动漫图像。我们根据简单而有效的风格与内容定义导出对抗损失。该对抗损失保证映射具有多样性——单个内容编码可生成极其广泛的动漫图像。在合理假设下,该映射不仅多样,而且正确表示了以输入人脸为条件的动漫概率。相比之下,当前的多模态生成方法无法捕捉动漫中出现的复杂风格。大量定量实验支持了映射正确的观点。大量定性结果表明,该方法能生成比 SOTA 对比方法多样得多的风格范围。最后,我们展示对内容与风格的形式化定义使我们能够执行视频到视频的翻译而无需在视频上训练。

关键词

引用

@article{arxiv.2106.06561,
  title  = {GANs N' Roses: Stable, Controllable, Diverse Image to Image Translation (works for videos too!)},
  author = {Min Jin Chong and David Forsyth},
  journal= {arXiv preprint arXiv:2106.06561},
  year   = {2021}
}

备注

code is here https://github.com/mchong6/GANsNRoses