基于区域-短语注意力的逼真图像生成
计算机视觉与模式识别
2019-02-15 v1 图形学
机器学习
机器学习
摘要
生成对抗网络(GAN)近来已被应用于从文本生成合成图像。尽管取得了显著进展,当前大多数最先进算法基于规则网格区域;在使用注意力时,主要应用于单个规则网格区域与单词之间。这些方法足以生成前景中包含单一物体(如“鸟”或“花”)的图像。然而,自然语言常涉及复杂的前景物体,且背景也可能占据生成图像的可变部分。因此,基于规则网格的图像注意力权重未必集中在预期的前景区域,进而导致图像看起来不自然。此外,像“a”、“blue”和“shirt”这样的单个单词除非组合使用,否则不一定提供完整的视觉上下文。为此,我们在本文中提出一种新方法,引入了真实网格区域与词组之间的一组额外注意力。真实网格区域由一组辅助边界框导出。这些辅助边界框作为更优的位置指示器,指示应与词组建立对齐与注意力的位置。词组通过对词性标注(POS)结果的分析得到。我们使用微软上下文中的常见物体(MSCOCO)数据集在该新颖网络架构上进行实验,模型以短句描述为条件生成 图像。与当前最先进算法相比,我们提出的方法能够生成更逼真的图像。
引用
@article{arxiv.1902.05395,
title = {Realistic Image Generation using Region-phrase Attention},
author = {Wanming Huang and Yida Xu and Ian Oppermann},
journal= {arXiv preprint arXiv:1902.05395},
year = {2019}
}