基于解耦表示的多样化图像到图像翻译
计算机视觉与模式识别
2018-08-03 v1
摘要
图像到图像翻译旨在学习两个视觉域之间的映射。许多应用面临两个主要挑战:1)缺乏对齐的训练对;2)单一输入图像可能存在多个输出。在本工作中,我们提出一种基于解耦表示的方案,用于在无配对训练图像的情况下生成多样化输出。为实现多样性,我们提议将图像嵌入两个空间:捕捉跨域共享信息的域不变内容空间,以及域特定属性空间。我们的模型在测试时采用从给定输入提取的编码内容特征以及从属性空间采样的属性向量来生成多样化输出。为处理未配对训练数据,我们引入了一种基于解耦表示的新型跨循环一致性损失。定性结果表明,我们的模型可在广泛任务上生成多样且真实的图像,且无需配对训练数据。对于定量比较,我们通过用户研究衡量真实感,并通过感知距离度量衡量多样性。我们将所提模型应用于域适应,并在 MNIST-M 与 LineMod 数据集上与最先进方法相比展现出有竞争力的性能。
引用
@article{arxiv.1808.00948,
title = {Diverse Image-to-Image Translation via Disentangled Representations},
author = {Hsin-Ying Lee and Hung-Yu Tseng and Jia-Bin Huang and Maneesh Kumar Singh and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:1808.00948},
year = {2018}
}
备注
ECCV 2018 (Oral). Project page: http://vllab.ucmerced.edu/hylee/DRIT/ Code: https://github.com/HsinYingLee/DRIT/