Adma-GAN:用于文本到图像生成的属性驱动记忆增强 GAN
计算机视觉与模式识别
2022-09-29 v1
摘要
作为一个具有挑战性的任务,文本到图像生成旨在根据给定文本描述生成照片级真实且语义一致的图像。现有方法主要从单一句子中提取文本信息来表示图像,且文本表示效果显著影响生成图像的质量。然而,直接利用单句中的有限信息会遗漏一些关键属性描述,而这些描述是准确描述图像的关键因素。为缓解上述问题,我们提出了一种借助属性信息补充的有效文本表示方法。首先,我们构建属性记忆,与句子输入联合控制文本到图像生成。其次,我们探索两种更新机制,样本感知与样本联合机制,以动态优化广义属性记忆。此外,我们设计属性-句子联合条件生成器学习方案,以对齐多表示间的特征嵌入,从而促进跨模态网络训练。实验结果表明,所提方法在 CUB(FID 从 14.81 降至 8.57)与 COCO(FID 从 21.42 降至 12.39)数据集上均取得大幅性能提升。
引用
@article{arxiv.2209.14046,
title = {Adma-GAN: Attribute-Driven Memory Augmented GANs for Text-to-Image Generation},
author = {Xintian Wu and Hanbin Zhao and Liangli Zheng and Shouhong Ding and Xi Li},
journal= {arXiv preprint arXiv:2209.14046},
year = {2022}
}