中文

基于文本描述学习全局编辑图像

计算机视觉与模式识别 2018-10-16 v1

摘要

我们展示了如何使用文本指令全局编辑图像:给定源图像与编辑的文本指令,生成在该指令下变换的新图像。为处理这一新问题,我们基于 RNN 与生成对抗网络(GAN)开发了三种不同的可训练模型。这些模型(桶式、滤波器组与端到端)在所编码专家知识多少上有所不同,其中最通用的版本为纯端到端。为训练这些系统,我们使用 Amazon Mechanical Turk 从多个数据集中采样的约 2000 个图像对收集文本描述。在我们数据集上评估的实验结果验证了我们的方法。此外,鉴于滤波器组模型在通用性与性能间为良好折衷,我们通过以图 RNN 替换 RNN 进一步研究它,并表明图 RNN 提升了性能。据我们所知,这是首个纯粹基于自由形式文本指令的全局图像编辑计算摄影工作。

关键词

引用

@article{arxiv.1810.05786,
  title  = {Learning to Globally Edit Images with Textual Description},
  author = {Hai Wang and Jason D. Williams and SingBing Kang},
  journal= {arXiv preprint arXiv:1810.05786},
  year   = {2018}
}