中文

DTGAN:用于文本生成图像的双重注意力生成对抗网络

计算机视觉与模式识别 2022-05-10 v3

摘要

大多数现有的文本生成图像方法采用多阶段模块化架构,其有三个显著问题:1) 训练多个网络增加了运行时间并影响生成模型的收敛与稳定性;2) 这些方法忽略了早期阶段生成器图像的质量;3) 需要训练多个判别器。为此,我们提出双重注意力生成对抗网络(DTGAN),其仅使用单一的生成器/判别器对即可合成高质量且语义一致的图像。所提模型引入了通道感知和像素感知注意力模块,可引导生成器基于全局句子向量关注与文本相关的通道和像素,并利用注意力权重微调原始特征图。此外,提出条件自适应实例层归一化(CAdaILN)以帮助我们的注意力模块通过输入的自然语言描述灵活控制形状和纹理的变化量。进一步,利用一种新型视觉损失,通过确保生成图像的生动形状和感知均匀的颜色分布来提升图像分辨率。在基准数据集上的实验结果表明,与具有多阶段框架的 SOTA 模型相比,我们提出的方法具有优越性。注意力图的可视化显示,通道感知注意力模块能够定位判别性区域,而像素感知注意力模块具有捕获全局视觉内容以生成图像的能力。

关键词

引用

@article{arxiv.2011.02709,
  title  = {DTGAN: Dual Attention Generative Adversarial Networks for Text-to-Image Generation},
  author = {Zhenxing Zhang and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2011.02709},
  year   = {2022}
}