中文

语义多模态图像合成

计算机视觉与模式识别 2020-04-03 v3

摘要

在本文中,我们关注语义多模态图像合成 (SMIS) 任务,即在语义层面生成多模态图像。先前工作试图使用多个类特定生成器,这限制了其在类别数量较少的数据集上的使用。我们转而提出一种新颖的分组递减网络 (GroupDNet),其在生成器中利用分组卷积,并逐步减少解码器中卷积的分组数。因此,GroupDNet 在将语义标签转换为自然图像时具备更强的可控性,并对类别众多的数据集产生合理的高质量结果。在多个具有挑战性的数据集上的实验证明了 GroupDNet 在执行 SMIS 任务上的优越性。我们还展示了 GroupDNet 能够执行广泛的趣味合成应用。代码与模型可见于:https://github.com/Seanseattle/SMIS。

关键词

引用

@article{arxiv.2003.12697,
  title  = {Semantically Multi-modal Image Synthesis},
  author = {Zhen Zhu and Zhiliang Xu and Ansheng You and Xiang Bai},
  journal= {arXiv preprint arXiv:2003.12697},
  year   = {2020}
}

备注

To appear in CVPR 2020