中文

在空间中不同位置生成多个对象

计算机视觉与模式识别 2019-01-04 v1 机器学习 神经与进化计算

摘要

生成对抗网络(GANs)近期的改进使得基于自然语言描述(如图像标题)生成高分辨率逼真图像成为可能。此外,条件 GAN 使我们能够通过标签甚至自然语言描述来控制图像生成过程。然而,对图像布局的细粒度控制,即图像中特定对象应位于何处,仍然难以实现。对于应在不同空间位置包含多个不同对象的图像而言,这一点尤其明显。我们引入了一种新方法,通过向生成器和判别器均添加对象通路,从而控制图像中任意多个对象的位置。我们的方法不需要详细的语义布局,仅需所需对象的边界框及其相应标签。对象通路仅关注各个对象,并在边界框指定的位置迭代应用。全局通路关注图像背景和总体图像布局。我们在 Multi-MNIST、CLEVR 以及更复杂的 MS-COCO 数据集上进行了实验。我们的实验表明,通过使用对象通路,我们可以控制图像中对象的位置,并能建模具有多个对象位于不同位置的复杂场景。我们进一步表明,对象通路关注各个对象并学习与这些对象相关的特征,而全局通路关注全局图像特征和图像背景。

关键词

引用

@article{arxiv.1901.00686,
  title  = {Generating Multiple Objects at Spatially Distinct Locations},
  author = {Tobias Hinz and Stefan Heinrich and Stefan Wermter},
  journal= {arXiv preprint arXiv:1901.00686},
  year   = {2019}
}

备注

Published at ICLR 2019