扩展 GAN 用于文本到图像合成
计算机视觉与模式识别
2023-06-21 v2 图形学
机器学习
摘要
近期文本到图像合成的成功席卷全球,并捕获了公众的想象力。从技术角度看,它也标志着设计生成图像模型的主流架构发生了剧烈变化。GAN 曾是事实上的选择,拥有 StyleGAN 等技术。随着 DALL-E 2 的出现,自回归和扩散模型一夜之间成为大规模生成模型的新标准。这种快速转变提出了一个根本问题:我们能否扩展 GAN 以受益于像 LAION 这样的大型数据集?我们发现朴素地增加 StyleGAN 架构的容量很快就会变得不稳定。我们引入了 GigaGAN,一种远超此限制的新 GAN 架构,证明了 GAN 作为文本到图像合成的可行选择。GigaGAN 提供三大主要优势。首先,它在推理时快几个数量级,仅需 0.13 秒即可合成一张 512px 图像。其次,它可以合成高分辨率图像,例如 3.66 秒内合成 1600 万像素的图像。最后,GigaGAN 支持各种潜空间编辑应用,如潜空间插值、风格混合和向量算术操作。
引用
@article{arxiv.2303.05511,
title = {Scaling up GANs for Text-to-Image Synthesis},
author = {Minguk Kang and Jun-Yan Zhu and Richard Zhang and Jaesik Park and Eli Shechtman and Sylvain Paris and Taesung Park},
journal= {arXiv preprint arXiv:2303.05511},
year = {2023}
}
备注
CVPR 2023. Project webpage at https://mingukkang.github.io/GigaGAN/