StyleSwin:基于 Transformer 的高分辨率图像生成 GAN
计算机视觉与模式识别
2022-07-22 v2
摘要
尽管 transformer 在广泛视觉任务中取得诱人成功,其在高分辨率图像生成建模上尚未展现出与 ConvNet 同等的力。本文中,我们探索使用纯 transformer 构建用于高分辨率图像合成的生成对抗网络。为此,我们认为局部注意力对于在计算效率与建模能力间取得平衡至关重要。因此,所提生成器在基于风格的架构中采用 Swin transformer。为获得更大感受野,我们提出双重注意力,同时利用局部与偏移窗口的上下文,从而提升生成质量。此外,我们表明提供基于窗口的 transformer 中丢失的绝对位置知识极大有益于生成质量。所提 StyleSwin 可扩展至高分辨率,粗几何与精细结构均受益于 transformer 的强表达力。然而,高分辨率合成中会出现块伪影,因为以块方式执行局部注意力可能破坏空间相干性。为解决此问题,我们经验性地探究多种方案,发现采用小波判别器检验频谱差异可有效抑制伪影。大量实验显示了相对于先前基于 transformer 的 GAN 的优越性,尤其在高分辨率如 1024x1024 上。StyleSwin 无需复杂训练策略,在 CelebA-HQ 1024 上优于 StyleGAN,并在 FFHQ-1024 上取得相当性能,证明了使用 transformer 进行高分辨率图像生成的前景。代码与模型将发布于 https://github.com/microsoft/StyleSwin。
引用
@article{arxiv.2112.10762,
title = {StyleSwin: Transformer-based GAN for High-resolution Image Generation},
author = {Bowen Zhang and Shuyang Gu and Bo Zhang and Jianmin Bao and Dong Chen and Fang Wen and Yong Wang and Baining Guo},
journal= {arXiv preprint arXiv:2112.10762},
year = {2022}
}
备注
CVPR 2022