Styleformer:基于Transformer且带风格向量的生成对抗网络
计算机视觉与模式识别
2022-04-06 v3 图像与视频处理
摘要
我们提出了 Styleformer,这是一种用于 GAN 架构的基于风格的生成器,但是一种无卷积、基于 transformer 的生成器。在本文中,我们解释了 transformer 如何生成高质量图像,克服了卷积操作难以捕捉图像全局特征的缺点。此外,我们改变了 StyleGAN2 的解调制,并修改了现有的 transformer 结构(例如残差连接、层归一化),以创建一个无卷积结构的强基于风格的生成器。我们还通过应用 Linformer 使 Styleformer 更轻量,使 Styleformer 能够生成更高分辨率的图像,并在速度和内存方面带来改进。我们在低分辨率图像数据集(如 CIFAR-10)以及高分辨率图像数据集(如 LSUN-church)上进行了实验。Styleformer 在基准数据集 CIFAR-10 上取得了 FID 2.82 和 IS 9.94,其性能与当前最先进(state-of-the-art, SOTA)水平相当,并在无条件设定下以更少的参数优于所有基于 GAN 的生成模型,包括 StyleGAN2-ADA。我们还分别在 STL-10 和 CelebA 上以 FID 15.17、IS 11.01 和 FID 3.66 取得了新的最先进结果。我们的代码发布于 https://github.com/Jeeseung-Park/Styleformer。
引用
@article{arxiv.2106.07023,
title = {Styleformer: Transformer based Generative Adversarial Networks with Style Vector},
author = {Jeeseung Park and Younggeun Kim},
journal= {arXiv preprint arXiv:2106.07023},
year = {2022}
}
备注
CVPR 2022