StEP:基于风格的编码器预训练用于多模态图像合成
计算机视觉与模式识别
2021-04-16 v1
摘要
我们提出了一种多模态图像到图像(I2I)翻译的新方法。为了处理输入和输出域之间的一对多关系,先前的工作使用复杂的训练目标来学习潜在嵌入,与生成器一起,以建模输出域的变异性。相比之下,我们直接建模图像的风格变异性,独立于图像合成任务。具体来说,我们使用一种新颖的代理任务预训练一个通用风格编码器,以学习来自任意域的图像嵌入到低维风格潜在空间。学习到的潜在空间相对于先前的多模态I2I翻译传统方法具有几个优势。首先,它不依赖于目标数据集,并且在多个域上具有良好的泛化能力。其次,它学习了一个更强大和更具表现力的潜在空间,提高了风格捕获和迁移的保真度。所提出的风格预训练还简化了训练目标并显著加快了训练速度。此外,我们详细研究了不同损失项对多模态I2I翻译任务的贡献,并提出了一种简单的VAE替代方案,以实现从无约束潜在空间的采样。最后,我们通过一个简单的训练目标(仅包含GAN损失和重建损失)在六个具有挑战性的基准上取得了最先进的结果。
引用
@article{arxiv.2104.07098,
title = {StEP: Style-based Encoder Pre-training for Multi-modal Image Synthesis},
author = {Moustafa Meshry and Yixuan Ren and Larry S Davis and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2104.07098},
year = {2021}
}
备注
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021