文本自适应生成对抗网络:用自然语言操控图像
计算机视觉与模式识别
2018-11-29 v2
摘要
本文研究利用自然语言描述操控图像的问题。我们的任务旨在根据描述新视觉外观的文本,语义地修改图像中物体的视觉属性。尽管现有方法能合成具有新属性的图像,但它们未能充分保留原始图像中与文本无关的内容。本文提出文本自适应生成对抗网络(TAGAN),以生成语义被操控的图像,同时保留与文本无关的内容。我们方法的关键在于文本自适应判别器,它根据输入文本创建词级局部判别器,以独立分类细粒度属性。借助该判别器,生成器学习生成仅修改与给定文本对应区域的图像。实验结果表明,我们的方法在 CUB 和 Oxford-102 数据集上优于现有方法,且在用户研究中多数结果更受青睐。大量分析表明,我们的方法能有效解耦视觉属性并生成令人满意的输出。
引用
@article{arxiv.1810.11919,
title = {Text-Adaptive Generative Adversarial Networks: Manipulating Images with Natural Language},
author = {Seonghyeon Nam and Yunji Kim and Seon Joo Kim},
journal= {arXiv preprint arXiv:1810.11919},
year = {2018}
}
备注
NeurIPS 2018