CRD-CGAN:用于多样化文本到图像生成的类别一致与相对约束
计算机视觉与模式识别
2021-07-29 v1
摘要
从文本描述生成照片级真实图像是计算机视觉中的一项挑战性问题。先前工作已展示通过生成对抗网络(GANs)以文本为条件生成合成图像的 promising 性能。在本文中,我们聚焦于类别一致与相对多样化约束以优化合成图像的多样性。基于这些约束,提出一种类别一致与相对多样化条件 GAN(CRD-CGAN)以同时合成 张照片级真实图像。我们利用注意力损失与多样性损失提升 GAN 对词注意力与噪声的敏感性。随后,采用相对条件损失估计合成图像相对真实或伪造的概率,可提升基础条件损失的性能。最后,引入类别一致损失以缓解 K 张合成图像间的过类别问题。我们在 Birds-200-2011、Oxford-102 flower 与 MSCOCO 2014 数据集上评估所提方法,大量实验证明了相较最先进方法,该方法在生成合成图像的照片真实性与多样性方面具优越性。
引用
@article{arxiv.2107.13516,
title = {CRD-CGAN: Category-Consistent and Relativistic Constraints for Diverse Text-to-Image Generation},
author = {Tao Hu and Chengjiang Long and Chunxia Xiao},
journal= {arXiv preprint arXiv:2107.13516},
year = {2021}
}