使用线性加性注意力Transformer的高效生成对抗网络
计算机视觉与模式识别
2025-07-08 v5 机器学习
摘要
尽管用于图像生成的深度生成模型(如扩散模型(DMs)和生成对抗网络(GANs))的能力近年来显著提升,但其成功很大程度上归功于计算成本高昂的架构。这限制了它们的使用范围,仅局限于拥有大量资源的研究实验室和公司,同时显著增加了训练、微调和推理的碳足迹。在这项工作中,我们提出了一种新颖的GAN架构,称为LadaGAN。该架构基于一个名为Ladaformer的线性注意力Transformer块。该块的主要组件是一种线性加性注意力机制,它为每个头计算单个注意力向量,而不是二次的点积注意力。我们在生成器和判别器中都采用了Ladaformer,这降低了计算复杂度,并克服了通常与Transformer GAN相关的训练不稳定性。LadaGAN在不同分辨率的基准数据集上持续优于现有的卷积和Transformer GAN,同时效率显著更高。此外,LadaGAN与最先进的多步生成模型(例如DMs)相比表现出有竞争力的性能,而使用的计算资源却少几个数量级。
引用
@article{arxiv.2401.09596,
title = {Efficient generative adversarial networks using linear additive-attention Transformers},
author = {Emilio Morales-Juarez and Gibran Fuentes-Pineda},
journal= {arXiv preprint arXiv:2401.09596},
year = {2025}
}
备注
13 pages, 8 figures