中文

基于 Token 生成器与 Transformer 的图像合成视觉质量提升

计算机视觉与模式识别 2021-12-21 v2

摘要

我们提出一种将图像合成视为视觉 token 生成问题的新视角。不同于直接从单一输入(如潜码)合成完整图像的现有范式,新公式支持对不同图像区域的灵活局部操控,从而可实现内容感知且细粒度的风格控制。具体而言,它输入一串潜 token 以预测用于合成图像的视觉 token。在此视角下,我们提出一种基于 token 的生成器(即 TokenGAN)。特别地,TokenGAN 输入两种语义不同的视觉 token,即学习到的恒定内容 token 与来自潜空间的风格 token。给定一串风格 token,TokenGAN 能够通过 Transformer 的注意力机制将风格分配给内容 token 来控制图像合成。我们进行了大量实验,表明所提 TokenGAN 在多个广泛使用的图像合成基准(包括不同分辨率的 FFHQ 与 LSUN CHURCH)上取得了最先进结果。尤其是,该生成器能够合成 1024x1024 尺寸的高保真图像,且完全摒弃卷积。

关键词

引用

@article{arxiv.2111.03481,
  title  = {Improving Visual Quality of Image Synthesis by A Token-based Generator with Transformers},
  author = {Yanhong Zeng and Huan Yang and Hongyang Chao and Jianbo Wang and Jianlong Fu},
  journal= {arXiv preprint arXiv:2111.03481},
  year   = {2021}
}

备注

NeurIPS 2021