中文

DiverGAN:一种高效且有效的多样化文本到图像生成单阶段框架

计算机视觉与模式识别 2022-05-10 v1 人工智能

摘要

在本文中,我们提出一种高效且有效的单阶段框架(DiverGAN),用于根据自然语言描述生成多样化、合理且语义一致的图像。DiverGAN 采用两个新颖的词级注意力模块,即通道注意力模块(CAM)和像素注意力模块(PAM),它们对给定句子中每个词的重要性进行建模,同时使网络能够将更大权重分配给与显著词在语义上对齐的重要通道和像素。此后,引入条件自适应实例-层归一化(CAdaILN),以使来自句子嵌入的语言线索灵活地操控形状和纹理的变化量,进一步改善视觉-语义表示并有助于稳定训练。此外,开发了双残差结构以在允许更深网络的同时保留更多原始视觉特征,从而实现更快的收敛速度和更生动的细节。进而,我们提出在流水线中插入一个全连接层以解决多样性不足问题,因为我们观察到稠密层将显著增强网络的生成能力,平衡低维随机潜码贡献变体与使用高维文本上下文增强特征图的调制模块之间的权衡。在第二个残差块后插入线性层取得了最佳的多样性和质量。在基准数据集上的定性和定量结果均证明了我们的 DiverGAN 在实现多样性方面的优越性,且不损害质量和语义一致性。

关键词

引用

@article{arxiv.2111.09267,
  title  = {DiverGAN: An Efficient and Effective Single-Stage Framework for Diverse Text-to-Image Generation},
  author = {Zhenxing Zhang and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2111.09267},
  year   = {2022}
}