基于 Transformer 的可扩展 GAN
计算机视觉与模式识别
2026-05-27 v2 人工智能
机器学习
摘要
可扩展性推动了生成式建模的最新进展,但其原理在对抗学习中仍鲜有探讨。我们通过两项在其他类型生成模型中被证明有效的设计选择来研究生成对抗网络(GAN)的可扩展性:在紧凑的变分自编码器潜空间中训练,并采用纯基于 Transformer 的生成器和判别器。在潜空间中训练能够在保持感知保真度的同时实现高效计算,而这种效率与性能随计算预算扩展的普通 Transformer 天然契合。基于这些选择,我们分析了朴素地扩展 GAN 时出现的失效模式。具体而言,我们发现了生成器中早期层未充分利用以及随网络规模扩大而出现的优化不稳定等问题。因此,我们提供了轻量级中间监督和宽度感知学习率调整等简单且利于扩展的解决方案。我们的实验表明,GAT(一种纯基于 Transformer 且在潜空间中工作的 GAN)能够在极广的容量范围(S 到 XL)内轻松可靠地完成训练。此外,GAT-XL/2 在 ImageNet-256 上仅用 40 个 epoch 便实现了最先进(SOTA)的单步类条件生成性能(FID 为 2.96),比强基线少用 6 倍的 epoch。项目页面:https://hse1032.github.io/GAT。
关键词
引用
@article{arxiv.2509.24935,
title = {Scalable GANs with Transformers},
author = {Sangeek Hyun and MinKyu Lee and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2509.24935},
year = {2026}
}
备注
ICML 2026