基于对比 GAN 的生成式语义操控
计算机视觉与模式识别
2017-08-02 v1
摘要
生成对抗网络 (GANs) 最近在成对/非成对图像到图像翻译方面取得了显著进展,例如照片素描和艺术绘画风格迁移。然而,现有模型只能转换低层信息(例如颜色或纹理变化),而无法编辑物体的高层语义含义(例如几何结构或内容)。另一方面,虽然一些研究可以根据类别标签或文字说明合成引人注目的真实世界图像,但它们不能以任意形状或结构为条件,这在很大程度上限制了其应用场景和模型结果的解释能力。在这项工作中,我们专注于一项更具挑战性的语义操控任务,旨在修改物体的语义含义同时保留其自身特征(例如视角和形状),例如牛羊、摩托车自行车、猫狗。为了应对这种巨大的语义变化,我们引入了一种具有新颖对抗对比目标的对比 GAN (contrast-GAN)。与以前的 GAN 直接使合成样本接近目标数据不同,我们的对抗对比目标在样本间的距离比较上进行优化,即强制操控后的数据在语义上比输入数据更接近具有目标类别的真实数据。配备了新的对比目标后,提出了一种新颖的掩码条件 contrast-GAN 架构,以实现图像背景与物体语义变化的解耦。在 ImageNet 和 MSCOCO 数据集上的多项语义操控任务实验表明,我们的 contrast-GAN 相比其他条件 GANs 取得了显著的性能提升。定量结果进一步证明了我们的模型在生成具有高视觉保真度和合理物体语义的操控结果方面的优越性。
引用
@article{arxiv.1708.00315,
title = {Generative Semantic Manipulation with Contrasting GAN},
author = {Xiaodan Liang and Hao Zhang and Eric P. Xing},
journal= {arXiv preprint arXiv:1708.00315},
year = {2017}
}