Style-Restricted GAN:基于生成对抗网络带风格限制的多模态图像翻译
计算机视觉与模式识别
2021-07-15 v2
摘要
使用生成对抗网络(GAN)的非配对图像到图像翻译在多域图像转换中已取得成功。此外,近期研究展示了使生成器输出多样化的方法。然而,由于对生成器如何使结果多样化的过程缺乏限制,其容易翻译出某些非预期特征。本文提出Style-Restricted GAN(SRGAN)以证明控制风格多样化过程中所用编码特征的重要性。具体而言,我们采用三种新损失而非KL散度损失来限制编码特征的分布:批量KL散度损失、相关性损失与直方图模仿损失。此外,编码器在用于翻译前先以分类任务进行预训练。本研究以Precision、Recall、Density与Coverage报告了定量与定性结果。所提三种损失相较传统KL损失提升了多样性水平。特别地,SRGAN在CelebA人脸数据集上被证实能成功实现更高多样性翻译且不改变与类别无关的特征。综上,通过两个实验证明了编码特征受良好约束的重要性。我们的实现见https://github.com/shinshoji01/Style-Restricted_GAN。
引用
@article{arxiv.2105.07621,
title = {Style-Restricted GAN: Multi-Modal Translation with Style Restriction Using Generative Adversarial Networks},
author = {Sho Inoue and Tad Gonsalves},
journal= {arXiv preprint arXiv:2105.07621},
year = {2021}
}
备注
20 pages, 11 figures, 6 tables; Our implementation is available at https://github.com/shinshoji01/Style-Restricted_GAN