中文

ManiGAN:文本引导的图像编辑

计算机视觉与模式识别 2020-04-01 v2 计算与语言 机器学习

摘要

本文的目标是语义化地编辑图像中与给定描述期望属性(如纹理、颜色和背景)的文本相匹配的部分,同时保留其他与文本无关的内容。为此,我们提出一种新颖的生成对抗网络(ManiGAN),其包含两个关键组件:文本-图像仿射组合模块(ACM)与细节校正模块(DCM)。ACM选取与给定文本相关的图像区域,并将这些区域与对应语义词关联以实现有效编辑;同时,它编码原始图像特征以辅助重建与文本无关的内容。DCM修正合成图像中不匹配的属性并补全缺失内容。最后,我们提出一种评估图像编辑结果的新指标,兼顾新属性的生成与文本无关内容的重建。在CUB和COCO数据集上的大量实验证明了所提方法的优越性能。代码见https://github.com/mrlibw/ManiGAN。

关键词

引用

@article{arxiv.1912.06203,
  title  = {ManiGAN: Text-Guided Image Manipulation},
  author = {Bowen Li and Xiaojuan Qi and Thomas Lukasiewicz and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:1912.06203},
  year   = {2020}
}

备注

CVPR 2020