TransGAN:两个纯 Transformer 可构成一个强 GAN,且能够扩展
计算机视觉与模式识别
2021-12-10 v4
摘要
近期对 transformer 的爆发式关注暗示了它们成为计算机视觉任务(如分类、检测和分割)强大“通用”模型的潜力。尽管这些尝试主要研究判别模型,我们探索 transformer 在一些更 notoriously 困难的视觉任务上的应用,例如生成对抗网络(GANs)。我们的目标是进行首项试点研究,构建完全无卷积、仅使用纯 transformer 架构的 GAN。我们朴素的 GAN 架构称为 TransGAN,由一个内存友好的、逐步提升特征分辨率的基于 transformer 的生成器,以及相应的多尺度判别器组成,以同时捕捉语义上下文与低级纹理。在此基础上,我们引入网格自注意力新模块以进一步缓解内存瓶颈,从而将 TransGAN 扩展到高分辨率生成。我们还开发了一套独特训练方法,包括一系列可缓解 TransGAN 训练不稳定性问题的技术,如数据增强、改进归一化和相对位置编码。我们的最佳架构相较于当前使用卷积骨干的顶尖 GAN 取得了极具竞争力的性能。具体而言,TransGAN 在 STL-10 上创下 10.43 的 inception score 与 18.28 的 FID 新纪录,优于 StyleGAN-V2。当涉及更高分辨率(如 256 x 256)生成任务时,例如在 CelebA-HQ 和 LSUN-Church 上,TransGAN 继续生成具有高热度与令人印象深刻的纹理细节的多样视觉样本。此外,我们深入探究基于 transformer 的生成模型,通过可视化训练动态来理解其行为与卷积模型的不同之处。代码见 https://github.com/VITA-Group/TransGAN。
引用
@article{arxiv.2102.07074,
title = {TransGAN: Two Pure Transformers Can Make One Strong GAN, and That Can Scale Up},
author = {Yifan Jiang and Shiyu Chang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2102.07074},
year = {2021}
}
备注
Accepted to NeruIPS 2021