中文

语义图像合成仅需对抗监督

计算机视觉与模式识别 2021-03-23 v3 机器学习 图像与视频处理

摘要

尽管近期取得了成功,仅在对抗监督下训练的语义图像合成 GAN 模型仍存在图像质量不佳的问题。历史上,额外采用基于 VGG 的感知损失有助于克服该问题,显著提升了合成质量,但同时也限制了语义图像合成 GAN 模型的发展。本文提出一种新颖、简化的 GAN 模型,仅需对抗监督即可获得高质量结果。我们将判别器重新设计为语义分割网络,直接使用给定的语义标签图作为训练真值。通过空间与语义感知的判别器反馈向判别器及生成器提供更强的监督,我们能够合成保真度更高、与输入标签图对齐更好的图像,从而使感知损失变得多余。此外,我们通过向生成器注入的 3D 噪声张量的全局与局部采样实现高质量多模态图像合成,从而允许完整或局部的图像改变。我们表明,由我们的模型合成的图像更加多样,并且更紧密地遵循真实图像的颜色与纹理分布。在仅使用对抗监督的情况下,我们在不同数据集上相比当前最优方法取得了平均 66 个 FID 和 55 个 mIoU 点的提升。

关键词

引用

@article{arxiv.2012.04781,
  title  = {You Only Need Adversarial Supervision for Semantic Image Synthesis},
  author = {Vadim Sushko and Edgar Schönfeld and Dan Zhang and Juergen Gall and Bernt Schiele and Anna Khoreva},
  journal= {arXiv preprint arXiv:2012.04781},
  year   = {2021}
}

备注

Published at ICLR 2021 (Main Conference). Code repository: https://github.com/boschresearch/OASIS