中文

多模态无监督图像到图像翻译

计算机视觉与模式识别 2018-08-16 v2 机器学习 机器学习

摘要

无监督图像到图像翻译是计算机视觉中一个重要且具有挑战性的问题。给定源域中的一幅图像,目标是学习目标域中对应图像的条件分布,而无需见到任何对应图像对。虽然该条件分布本质上是多模态的,现有方法作出了过度简化的假设,将其建模为确定性的单射映射。因此,它们无法从给定的源域图像生成多样化输出。为克服此局限,我们提出了一种多模态无监督图像到图像翻译(MUNIT)框架。我们假设图像表示可分解为域不变的内容编码,以及捕捉域特定属性的风格编码。要将一幅图像翻译到另一域,我们将其内容编码与目标域风格空间中采样得到的随机风格编码重新组合。我们分析了所提框架并建立了若干理论结果。与最先进方法的对比的大量实验进一步证明了该框架的优势。此外,我们的框架允许用户通过提供示例风格图像来控制翻译输出的风格。代码与预训练模型可在 https://github.com/nvlabs/MUNIT 获取。

关键词

引用

@article{arxiv.1804.04732,
  title  = {Multimodal Unsupervised Image-to-Image Translation},
  author = {Xun Huang and Ming-Yu Liu and Serge Belongie and Jan Kautz},
  journal= {arXiv preprint arXiv:1804.04732},
  year   = {2018}
}

备注

Accepted by ECCV 2018