中文

讲述、绘制并重复:基于连续语言指令的图像生成与修改

计算机视觉与模式识别 2019-09-24 v3

摘要

条件文本到图像生成是一个活跃的研究领域,具有许多可能的应用。现有研究主要聚焦于利用可用条件信息一步生成单张图像。一步生成之外的一个实际扩展是这样一个系统:它基于持续的语言输入或反馈迭代地生成图像。这比一步生成任务更具挑战性,因为此类系统必须理解其生成图像的内容相对于反馈历史、当前反馈以及反馈历史中概念间相互作用的关系。在本工作中,我们提出了一种循环图像生成模型,其同时考虑截至当前步的生成输出以及所有过去的生成指令。我们展示了我们的模型能够生成背景、添加新对象并对已有对象施加简单变换。我们认为我们的方法是迈向交互式生成的重要一步。代码与数据可在 https://www.microsoft.com/en-us/research/project/generative-neural-visual-artist-geneva/ 获取。

关键词

引用

@article{arxiv.1811.09845,
  title  = {Tell, Draw, and Repeat: Generating and Modifying Images Based on Continual Linguistic Instruction},
  author = {Alaaeldin El-Nouby and Shikhar Sharma and Hannes Schulz and Devon Hjelm and Layla El Asri and Samira Ebrahimi Kahou and Yoshua Bengio and Graham W. Taylor},
  journal= {arXiv preprint arXiv:1811.09845},
  year   = {2019}
}

备注

Accepted at ICCV 2019