中文

AttnGAN:基于注意力生成对抗网络的细粒度文本到图像生成

计算机视觉与模式识别 2017-11-30 v1

摘要

在本文中,我们提出一种注意力生成对抗网络(AttnGAN),该网络通过注意力驱动的多阶段细化实现细粒度文本到图像生成。借助一种新颖的注意力生成网络,AttnGAN 能够通过关注自然语言描述中的相关词语,在图像的不同子区域合成细粒度细节。此外,我们提出一种深度注意力多模态相似度模型,用于计算细粒度的图像-文本匹配损失以训练生成器。所提出的 AttnGAN 显著优于先前的最优方法,在 CUB 数据集上将最佳已报道的 inception score 提升了 14.14%,在更具挑战性的 COCO 数据集上提升了 170.25%。我们还通过可视化 AttnGAN 的注意力层进行了详细分析。这首次表明,分层注意力 GAN 能够自动在词级别选择条件以生成图像的不同部分。

关键词

引用

@article{arxiv.1711.10485,
  title  = {AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks},
  author = {Tao Xu and Pengchuan Zhang and Qiuyuan Huang and Han Zhang and Zhe Gan and Xiaolei Huang and Xiaodong He},
  journal= {arXiv preprint arXiv:1711.10485},
  year   = {2017}
}