中文

CAGAN:基于组合注意力 GAN 的文本到图像生成

计算机视觉与模式识别 2022-01-17 v4

摘要

依据自然语言描述生成图像是一项具有挑战性的任务。先前的研究主要通过考察空间注意力和/或文本注意力的使用来提升生成质量,从而忽视了通道之间的关系。在本工作中,我们提出组合注意力生成对抗网络(CAGAN)以根据文本描述生成照片级真实感图像。所提出的 CAGAN 利用两种注意力模型:词注意力以根据相关词绘制不同子区域;以及压缩激励注意力以捕获通道间的非线性交互。通过谱归一化稳定训练,我们提出的 CAGAN 在 CUB 数据集上的 IS 和 FID 以及更具挑战性的 COCO 数据集上的 FID 均超越了当前最优(SOTA)。此外,我们通过开发一个增加局部自注意力的额外模型表明,仅凭单一评估指标评判模型可能产生误导:该模型取得了更高的 IS,在 CUB 数据集上优于 SOTA,但却因特征重复生成了不真实的图像。

关键词

引用

@article{arxiv.2104.12663,
  title  = {CAGAN: Text-To-Image Generation with Combined Attention GANs},
  author = {Henning Schulze and Dogucan Yaman and Alexander Waibel},
  journal= {arXiv preprint arXiv:2104.12663},
  year   = {2022}
}