中文

文本自适应生成对抗网络:用自然语言操控图像

计算机视觉与模式识别 2018-11-29 v2

摘要

本文研究利用自然语言描述操控图像的问题。我们的任务旨在根据描述新视觉外观的文本,语义地修改图像中物体的视觉属性。尽管现有方法能合成具有新属性的图像,但它们未能充分保留原始图像中与文本无关的内容。本文提出文本自适应生成对抗网络(TAGAN),以生成语义被操控的图像,同时保留与文本无关的内容。我们方法的关键在于文本自适应判别器,它根据输入文本创建词级局部判别器,以独立分类细粒度属性。借助该判别器,生成器学习生成仅修改与给定文本对应区域的图像。实验结果表明,我们的方法在 CUB 和 Oxford-102 数据集上优于现有方法,且在用户研究中多数结果更受青睐。大量分析表明,我们的方法能有效解耦视觉属性并生成令人满意的输出。

关键词

引用

@article{arxiv.1810.11919,
  title  = {Text-Adaptive Generative Adversarial Networks: Manipulating Images with Natural Language},
  author = {Seonghyeon Nam and Yunji Kim and Seon Joo Kim},
  journal= {arXiv preprint arXiv:1810.11919},
  year   = {2018}
}

备注

NeurIPS 2018