面向可解释条件文本到图像GAN的优化潜码选择
计算机视觉与模式识别
2022-04-28 v1
摘要
由于条件生成对抗网络(GAN)的进步,文本到图像生成任务取得了显著进展。然而,现有的条件文本到图像GAN方法大多集中于提高图像质量和语义相关性,而忽略了模型的可解释性,这在现实世界应用中起着至关重要的作用。在本文中,我们提出了多种技术来深入探究条件文本到图像GAN模型的潜空间和语义空间。我们引入了潜码的成对线性插值和“语言”线性插值,以研究模型在潜空间和“语言”嵌入中学到了什么。随后,我们将线性插值扩展为以三个角点为条件的三角插值,以进一步分析模型。之后,我们构建了一个包含不成功和成功合成样本及相应潜码的Good/Bad数据集,用于图像质量研究。基于此数据集,我们提出了一个利用线性SVM寻找良好潜码的框架。在两个基准数据集上训练的近期DiverGAN生成器上的实验结果定性地证明了我们提出的技术的有效性,在预测潜向量的Good/Bad类别方面准确率超过94%。Good/Bad数据集可在https://zenodo.org/record/5850224#.YeGMwP7MKUk公开获取。
引用
@article{arxiv.2204.12678,
title = {Optimized latent-code selection for explainable conditional text-to-image GANs},
author = {Zhenxing Zhang and Lambert Schomaker},
journal= {arXiv preprint arXiv:2204.12678},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2202.12929