DM-GAN:用于文本到图像合成的动态记忆生成对抗网络
计算机视觉与模式识别
2019-04-03 v1
摘要
本文关注由文本描述生成逼真图像。现有方法首先生成具有粗略形状和颜色的初始图像,然后将初始图像精炼为高分辨率图像。大多数现有文本到图像合成方法存在两个主要问题。(1)这些方法严重依赖初始图像的质量。若初始图像初始化不佳,后续过程难以将图像精炼至令人满意的质量。(2)每个词在刻画不同图像内容时贡献的重要性程度不同,然而现有图像精炼过程中使用了不变的文本表示。本文中,我们提出动态记忆生成对抗网络(DM-GAN)以生成高质量图像。所提方法引入动态记忆模块,在初始图像生成不佳时精炼模糊图像内容。设计了记忆写入门以基于初始图像内容筛选重要文本信息,使我们的方法能从文本描述准确生成图像。我们还利用响应门自适应融合从记忆读取的信息与图像特征。我们在Caltech-UCSD Birds 200数据集与Microsoft Common Objects in Context数据集上评估DM-GAN模型。实验结果表明,我们的DM-GAN模型相对于最先进方法表现更优。
引用
@article{arxiv.1904.01310,
title = {DM-GAN: Dynamic Memory Generative Adversarial Networks for Text-to-Image Synthesis},
author = {Minfeng Zhu and Pingbo Pan and Wei Chen and Yi Yang},
journal= {arXiv preprint arXiv:1904.01310},
year = {2019}
}
备注
2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)