中文

基于场景图的交互式图像生成

计算机视觉与模式识别 2019-05-10 v1 人工智能 机器学习

摘要

近年来,在从基于场景的文本描述生成图像这一领域取得了一些令人振奋的进展。这些方法主要集中于从静态文本描述生成图像,且局限于单次生成图像,无法基于逐步递增的文本描述(这种方式更直观,也更接近我们描述图像的方式)交互式地生成图像。我们提出了一种基于一系列场景描述图(场景图)逐步生成图像的方法。我们提出了一种循环网络架构,该架构保留前序步骤生成的图像内容,并根据新提供的场景信息修改累积图像。我们的模型利用图卷积网络(GCN)来处理可变大小的场景图,并结合生成对抗图像翻译网络,在训练过程中无需任何中间监督即可生成真实的多目标图像。我们在 Coco-Stuff 数据集上进行了实验,该数据集包含多目标图像以及描述视觉场景的标注,结果表明,在针对逐步增长的场景图生成视觉一致的图像时,我们的模型在同一数据集上显著优于其他方法。

关键词

引用

@article{arxiv.1905.03743,
  title  = {Interactive Image Generation Using Scene Graphs},
  author = {Gaurav Mittal and Shubham Agrawal and Anuva Agarwal and Sushant Mehta and Tanya Marwah},
  journal= {arXiv preprint arXiv:1905.03743},
  year   = {2019}
}

备注

Published at ICLR 2019 Deep Generative Models for Highly Structured Data Workshop