中文

CogView3:通过中继扩散实现更精细、更快速的文本到图像生成

计算机视觉与模式识别 2024-03-11 v1

摘要

近期文本到图像生成系统的进步主要由扩散模型驱动。然而,单阶段文本到图像扩散模型在计算效率和图像细节细化方面仍面临挑战。为解决这一问题,我们提出了 CogView3,这是一种增强文本到图像扩散性能的创新级联框架。CogView3 是首个在文本到图像生成领域实施中继扩散的模型,它通过首先生成低分辨率图像,随后应用基于中继的超分辨率来执行任务。该方法不仅产生了具有竞争力的文本到图像输出,还大幅降低了训练和推理成本。实验结果表明,CogView3 在人工评估中优于当前最先进的开源文本到图像扩散模型 SDXL 77.0%,同时仅需约 SDXL 一半的推理时间。CogView3 的蒸馏变体在仅使用 SDXL 1/10 推理时间的情况下,实现了相当的性能。

关键词

引用

@article{arxiv.2403.05121,
  title  = {CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion},
  author = {Wendi Zheng and Jiayan Teng and Zhuoyi Yang and Weihan Wang and Jidong Chen and Xiaotao Gu and Yuxiao Dong and Ming Ding and Jie Tang},
  journal= {arXiv preprint arXiv:2403.05121},
  year   = {2024}
}