中文

UFOGen:基于扩散 GAN 的一次前向大规模文本到图像生成

计算机视觉与模式识别 2023-12-08 v5

摘要

文本到图像扩散模型已展现出将文本提示转化为连贯图像的卓越能力,但其推理的计算成本仍是一项持续挑战。为解决此问题,我们提出 UFOGen,一种专为超快单步文本到图像合成设计的新型生成模型。与侧重于改进采样器或采用蒸馏技术的常规扩散模型方法不同,UFOGen 采用混合方法,将扩散模型与 GAN 目标相结合。借助新引入的扩散-GAN 目标以及预训练扩散模型的初始化,UFOGen 擅长以单步高效生成以文本描述为条件的高质量图像。除传统文本到图像生成外,UFOGen 在应用中展现出多功能性。值得注意的是,UFOGen 是首批实现单步文本到图像生成及多样化下游任务的模型之一,代表了高效生成模型领域的重大进展。

关键词

引用

@article{arxiv.2311.09257,
  title  = {UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANs},
  author = {Yanwu Xu and Yang Zhao and Zhisheng Xiao and Tingbo Hou},
  journal= {arXiv preprint arXiv:2311.09257},
  year   = {2023}
}