OptGAN:条件文本到图像 GAN 的潜空间优化与可解释性研究
计算机视觉与模式识别
2022-03-01 v1 机器学习
摘要
文本到图像生成旨在根据文本描述自动生成照片级真实感图像,可潜在应用于艺术创作、数据增强、照片编辑等领域。尽管已有诸多研究投入此任务,生成可信、自然的场景仍极具挑战。为促进文本到图像合成的实际应用,我们聚焦于以下三个问题:1)如何确保生成样本可信、真实或自然?2)如何利用生成器的潜空间编辑合成图像?3)如何提升文本到图像生成框架的可解释性?本工作中,我们依据严格标准构建了两个新颖数据集(即好/坏鸟与人脸数据集),包含成功与失败的生成样本。为通过提高生成良好潜码的概率来有效且高效地获取高质量图像,我们使用了一个专用的好/坏分类器对生成图像进行分类,其基于预训练前端并在所提好/坏数据集上微调。此后,我们提出一种新算法,通过对生成器预训练权重值执行独立成分分析,在条件文本到图像 GAN 架构的潜空间中识别语义可理解方向。此外,我们开发了背景平坦化损失(BFL)以改善编辑图像中的背景外观。随后,我们引入关键词对之间的线性插值分析,并扩展为类似的三角“语言”插值,以深入探究文本到图像合成模型在语言嵌入中所学内容。我们的数据集可从 https://zenodo.org/record/6283798#.YhkN_ujMI2w 获取。
引用
@article{arxiv.2202.12929,
title = {OptGAN: Optimizing and Interpreting the Latent Space of the Conditional Text-to-Image GANs},
author = {Zhenxing Zhang and Lambert Schomaker},
journal= {arXiv preprint arXiv:2202.12929},
year = {2022}
}
备注
18 pages