中文

面向可解释条件文本到图像GAN的优化潜码选择

计算机视觉与模式识别 2022-04-28 v1

摘要

由于条件生成对抗网络(GAN)的进步,文本到图像生成任务取得了显著进展。然而,现有的条件文本到图像GAN方法大多集中于提高图像质量和语义相关性,而忽略了模型的可解释性,这在现实世界应用中起着至关重要的作用。在本文中,我们提出了多种技术来深入探究条件文本到图像GAN模型的潜空间和语义空间。我们引入了潜码的成对线性插值和“语言”线性插值,以研究模型在潜空间和“语言”嵌入中学到了什么。随后,我们将线性插值扩展为以三个角点为条件的三角插值,以进一步分析模型。之后,我们构建了一个包含不成功和成功合成样本及相应潜码的Good/Bad数据集,用于图像质量研究。基于此数据集,我们提出了一个利用线性SVM寻找良好潜码的框架。在两个基准数据集上训练的近期DiverGAN生成器上的实验结果定性地证明了我们提出的技术的有效性,在预测潜向量的Good/Bad类别方面准确率超过94%。Good/Bad数据集可在https://zenodo.org/record/5850224#.YeGMwP7MKUk公开获取。

关键词

引用

@article{arxiv.2204.12678,
  title  = {Optimized latent-code selection for explainable conditional text-to-image GANs},
  author = {Zhenxing Zhang and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2204.12678},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2202.12929