无监督多对多图像翻译中正确性的评估
计算机视觉与模式识别
2021-08-23 v2
摘要
给定来自源域的输入图像和来自目标域的引导图像,无监督多对多图像到图像(UMMI2I)翻译方法旨在生成来自目标域的逼真样本,该样本保留输入源图像的域不变信息,并从引导图像继承域特定信息。例如,在将女性人脸翻译为男性人脸时,生成的男性人脸应具有与输入女性图像相同的表情、姿态和发色,以及与引导男性图像相同的面部发型和其他男性特定属性。当前最先进的 UMMI2I 方法生成视觉上令人愉悦的图像,但鉴于大多数真实数据集对我们而言不知哪些属性是域特定的、哪些是域不变的,现有方法的语义正确性尚未得到定量评估。本文中,我们提出一组用于评估这些方法语义正确性的基准与指标。我们对现有最先进 UMMI2I 翻译方法进行了广泛研究,表明所有方法在不同程度上均未能从数据推断哪些属性是域特定的、哪些是域不变的,且主要依赖硬编码于其架构中的归纳偏置。
引用
@article{arxiv.2103.15727,
title = {Evaluation of Correctness in Unsupervised Many-to-Many Image Translation},
author = {Dina Bashkirova and Ben Usman and Kate Saenko},
journal= {arXiv preprint arXiv:2103.15727},
year = {2021}
}