文本作为神经算子:基于文本指令的图像操控
计算机视觉与模式识别
2021-11-30 v4
摘要
近年来,文本引导的图像操控在多媒体和计算机视觉领域获得了越来越多的关注。条件图像生成的输入已从仅图像演变为多模态。在本文中,我们研究了一种设置,允许用户使用复杂的文本指令对包含多个对象的图像进行编辑,以添加、移除或更改对象。该任务的输入是多模态的,包括(1)一张参考图像和(2)描述所需图像修改的自然语言指令。我们提出了一种基于 GAN 的方法来解决这个问题。核心思想是将文本视为神经算子,以局部修改图像特征。我们表明,在三个公开数据集上,所提出的模型优于近期强基线方法。具体而言,它生成了具有更高保真度和语义相关性的图像,并且当用作图像查询时,带来了更好的检索性能。
引用
@article{arxiv.2008.04556,
title = {Text as Neural Operator: Image Manipulation by Text Instruction},
author = {Tianhao Zhang and Hung-Yu Tseng and Lu Jiang and Weilong Yang and Honglak Lee and Irfan Essa},
journal= {arXiv preprint arXiv:2008.04556},
year = {2021}
}