中文

ViTGAN:用视觉 Transformer 训练 GAN

计算机视觉与模式识别 2024-05-30 v2 机器学习 图像与视频处理

摘要

近来,视觉 Transformer(ViT)在图像识别上展现出具有竞争力的性能,同时所需视觉特定归纳偏置更少。本文中,我们探究此类性能能否扩展到图像生成。为此,我们将 ViT 架构整合进生成对抗网络(GAN)。对于 ViT 判别器,我们观察到现有的 GAN 正则化方法与自注意力交互不良,导致训练期间严重不稳定。为解决该问题,我们引入若干用于以 ViT 训练 GAN 的新颖正则化技术。对于 ViT 生成器,我们审视潜在与像素映射层的架构选择以促进收敛。经验上,我们命名为 ViTGAN 的方法在 CIFAR-10、CelebA 与 LSUN bedroom 三个数据集上取得了与领先的基于 CNN 的 GAN 模型相当的性能。

关键词

引用

@article{arxiv.2107.04589,
  title  = {ViTGAN: Training GANs with Vision Transformers},
  author = {Kwonjoon Lee and Huiwen Chang and Lu Jiang and Han Zhang and Zhuowen Tu and Ce Liu},
  journal= {arXiv preprint arXiv:2107.04589},
  year   = {2024}
}

备注

Accepted to ICLR 2022 (Spotlight)