AttnGAN:基于注意力生成对抗网络的细粒度文本到图像生成
计算机视觉与模式识别
2017-11-30 v1
摘要
在本文中,我们提出一种注意力生成对抗网络(AttnGAN),该网络通过注意力驱动的多阶段细化实现细粒度文本到图像生成。借助一种新颖的注意力生成网络,AttnGAN 能够通过关注自然语言描述中的相关词语,在图像的不同子区域合成细粒度细节。此外,我们提出一种深度注意力多模态相似度模型,用于计算细粒度的图像-文本匹配损失以训练生成器。所提出的 AttnGAN 显著优于先前的最优方法,在 CUB 数据集上将最佳已报道的 inception score 提升了 14.14%,在更具挑战性的 COCO 数据集上提升了 170.25%。我们还通过可视化 AttnGAN 的注意力层进行了详细分析。这首次表明,分层注意力 GAN 能够自动在词级别选择条件以生成图像的不同部分。
引用
@article{arxiv.1711.10485,
title = {AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks},
author = {Tao Xu and Pengchuan Zhang and Qiuyuan Huang and Han Zhang and Zhe Gan and Xiaolei Huang and Xiaodong He},
journal= {arXiv preprint arXiv:1711.10485},
year = {2017}
}