ViTGAN:用视觉 Transformer 训练 GAN
计算机视觉与模式识别
2024-05-30 v2 机器学习
图像与视频处理
摘要
近来,视觉 Transformer(ViT)在图像识别上展现出具有竞争力的性能,同时所需视觉特定归纳偏置更少。本文中,我们探究此类性能能否扩展到图像生成。为此,我们将 ViT 架构整合进生成对抗网络(GAN)。对于 ViT 判别器,我们观察到现有的 GAN 正则化方法与自注意力交互不良,导致训练期间严重不稳定。为解决该问题,我们引入若干用于以 ViT 训练 GAN 的新颖正则化技术。对于 ViT 生成器,我们审视潜在与像素映射层的架构选择以促进收敛。经验上,我们命名为 ViTGAN 的方法在 CIFAR-10、CelebA 与 LSUN bedroom 三个数据集上取得了与领先的基于 CNN 的 GAN 模型相当的性能。
引用
@article{arxiv.2107.04589,
title = {ViTGAN: Training GANs with Vision Transformers},
author = {Kwonjoon Lee and Huiwen Chang and Lu Jiang and Han Zhang and Zhuowen Tu and Ce Liu},
journal= {arXiv preprint arXiv:2107.04589},
year = {2024}
}
备注
Accepted to ICLR 2022 (Spotlight)