中文

基于区域-短语注意力的逼真图像生成

计算机视觉与模式识别 2019-02-15 v1 图形学 机器学习 机器学习

摘要

生成对抗网络(GAN)近来已被应用于从文本生成合成图像。尽管取得了显著进展,当前大多数最先进算法基于规则网格区域;在使用注意力时,主要应用于单个规则网格区域与单词之间。这些方法足以生成前景中包含单一物体(如“鸟”或“花”)的图像。然而,自然语言常涉及复杂的前景物体,且背景也可能占据生成图像的可变部分。因此,基于规则网格的图像注意力权重未必集中在预期的前景区域,进而导致图像看起来不自然。此外,像“a”、“blue”和“shirt”这样的单个单词除非组合使用,否则不一定提供完整的视觉上下文。为此,我们在本文中提出一种新方法,引入了真实网格区域与词组之间的一组额外注意力。真实网格区域由一组辅助边界框导出。这些辅助边界框作为更优的位置指示器,指示应与词组建立对齐与注意力的位置。词组通过对词性标注(POS)结果的分析得到。我们使用微软上下文中的常见物体(MSCOCO)数据集在该新颖网络架构上进行实验,模型以短句描述为条件生成 256×256256 \times 256 图像。与当前最先进算法相比,我们提出的方法能够生成更逼真的图像。

关键词

引用

@article{arxiv.1902.05395,
  title  = {Realistic Image Generation using Region-phrase Attention},
  author = {Wanming Huang and Yida Xu and Ian Oppermann},
  journal= {arXiv preprint arXiv:1902.05395},
  year   = {2019}
}