CAGAN:基于组合注意力 GAN 的文本到图像生成
计算机视觉与模式识别
2022-01-17 v4
摘要
依据自然语言描述生成图像是一项具有挑战性的任务。先前的研究主要通过考察空间注意力和/或文本注意力的使用来提升生成质量,从而忽视了通道之间的关系。在本工作中,我们提出组合注意力生成对抗网络(CAGAN)以根据文本描述生成照片级真实感图像。所提出的 CAGAN 利用两种注意力模型:词注意力以根据相关词绘制不同子区域;以及压缩激励注意力以捕获通道间的非线性交互。通过谱归一化稳定训练,我们提出的 CAGAN 在 CUB 数据集上的 IS 和 FID 以及更具挑战性的 COCO 数据集上的 FID 均超越了当前最优(SOTA)。此外,我们通过开发一个增加局部自注意力的额外模型表明,仅凭单一评估指标评判模型可能产生误导:该模型取得了更高的 IS,在 CUB 数据集上优于 SOTA,但却因特征重复生成了不真实的图像。
引用
@article{arxiv.2104.12663,
title = {CAGAN: Text-To-Image Generation with Combined Attention GANs},
author = {Henning Schulze and Dogucan Yaman and Alexander Waibel},
journal= {arXiv preprint arXiv:2104.12663},
year = {2022}
}