使用堆叠条件变分自编码器与条件生成对抗网络的图像文本合成
计算机视觉与模式识别
2022-08-16 v2 图像与视频处理
摘要
从文本描述合成逼真图像是计算机视觉中的一大挑战。当前的文本到图像合成方法难以生成代表文本描述符的高分辨率图像。大多数现有研究依赖于生成对抗网络(GANs)或变分自编码器(VAEs)。GANs 能生成更清晰的图像但缺乏输出多样性,而 VAEs 擅长生成多样化输出,但生成的图像常模糊。考虑到 GANs 和 VAEs 的相对优势,我们提出了一种新的堆叠条件 VAE(CVAE)和条件 GAN(CGAN)网络架构,用于基于文本描述合成图像。本研究使用条件 VAE 作为初始生成器,产生文本描述符的高级草图。来自第一阶段的高级草图输出与文本描述符一同作为条件 GAN 网络的输入。第二阶段 GAN 生成 256x256 高分辨率图像。所提架构受益于条件 GAN 网络上的条件增强和残差块以实现结果。使用 CUB 和 Oxford-102 数据集进行了多次实验,并将所提方法结果与 StackGAN 等最先进技术比较。实验表明,所提方法能生成基于文本描述的高分辨率图像,并基于两个数据集的 Inception 和 Frechet Inception 分数取得有竞争力的结果。
引用
@article{arxiv.2207.03332,
title = {Text to Image Synthesis using Stacked Conditional Variational Autoencoders and Conditional Generative Adversarial Networks},
author = {Haileleol Tibebu and Aadil Malik and Varuna De Silva},
journal= {arXiv preprint arXiv:2207.03332},
year = {2022}
}