中文

基于 Transformer 的高分辨率复杂场景合成

计算机视觉与模式识别 2021-05-14 v1

摘要

近来,利用粗粒度布局通过深度生成模型可控合成复杂场景图像的做法日益流行。然而,当前方法的结果仍未能兑现其高分辨率合成的承诺。我们假设这主要归因于这些方法高度工程化的本质,它们常依赖辅助损失与中间步骤(如掩码生成器)。在本札记中,我们提出一种正交的任务处理方法,其生成模型基于纯似然训练而无额外目标。为此,我们首先通过对抗训练优化一个强大的压缩模型,该模型借助离散潜变量瓶颈学习重建其输入,从而有效剥离纹理等高频细节的潜表示。随后,我们训练一个自回归 transformer 模型,以布局的令牌化版本为条件学习离散图像表示的分布。我们的实验表明,所得系统能够合成与给定布局一致的高质量图像。特别地,我们将 COCO-Stuff 和 Visual Genome 上的 SOTA FID 分数分别提升多达 19% 和 53%,并展示了在 COCO 和 Open Images 上最高 512 x 512 像素的图像合成。

关键词

引用

@article{arxiv.2105.06458,
  title  = {High-Resolution Complex Scene Synthesis with Transformers},
  author = {Manuel Jahn and Robin Rombach and Björn Ommer},
  journal= {arXiv preprint arXiv:2105.06458},
  year   = {2021}
}

备注

AI for Content Creation Workshop, CVPR 2021