弱监督图像生成中风格与语义的控制
计算机视觉与模式识别
2020-11-23 v2
摘要
我们提出一种弱监督方法,用于复杂场景的条件图像生成,用户可精细控制场景中出现的物体。我们利用稀疏语义图控制物体形状与类别,并利用文本描述或属性控制局部与全局风格。为了以文本描述条件化我们的模型,我们引入了一个语义注意力模块,其计算开销与图像分辨率无关。为了进一步增强场景的可控性,我们提出一种将背景与前景分解的两步生成方案。用于训练我们模型的标签图由大词汇表物体检测器生成,从而能够利用无标注数据并提供结构化实例信息。在此设定下,我们报告了比在真实语义图上训练模型的 fully-supervised 设定更好的FID分数。我们还在COCO与Visual Genome等复杂数据集上展示了模型操控场景的能力。
引用
@article{arxiv.1912.03161,
title = {Controlling Style and Semantics in Weakly-Supervised Image Generation},
author = {Dario Pavllo and Aurelien Lucchi and Thomas Hofmann},
journal= {arXiv preprint arXiv:1912.03161},
year = {2020}
}
备注
European Conference on Computer Vision (ECCV) 2020, Spotlight. Code at https://github.com/dariopavllo/style-semantics