StyleGAN-T:释放 GAN 在快速大规模文本到图像合成中的威力
机器学习
2023-01-24 v1 计算机视觉与模式识别
摘要
得益于大型预训练语言模型、大规模训练数据以及可扩展模型族(如扩散模型和自回归模型)的引入,文本到图像合成近来取得了显著进展。然而,性能最佳的模型需要迭代评估才能生成单个样本。相比之下,生成对抗网络(GANs)仅需一次前向传播。因此它们快得多,但在大规模文本到图像合成中目前仍远落后于最先进水平。本文旨在确定重获竞争力所需的步骤。我们提出的模型 StyleGAN-T 解决了大规模文本到图像合成的具体要求,例如大容量、在多样数据集上的稳定训练、强文本对齐以及可控的变化与文本对齐权衡。StyleGAN-T 相比以往的 GAN 有显著改进,并在样本质量和速度方面优于蒸馏扩散模型——此前快速文本到图像合成中的最先进水平。
引用
@article{arxiv.2301.09515,
title = {StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis},
author = {Axel Sauer and Tero Karras and Samuli Laine and Andreas Geiger and Timo Aila},
journal= {arXiv preprint arXiv:2301.09515},
year = {2023}
}
备注
Project page: https://sites.google.com/view/stylegan-t/