中文

用于一次性高分辨率文本到图像合成的分层扩散模型

计算机视觉与模式识别 2024-07-09 v1 人工智能

摘要

我们提出了一种一次性文本到图像扩散模型,该模型能够从自然语言描述生成高分辨率图像。我们的模型采用分层U-Net架构,可同时在多个分辨率尺度上合成图像。我们表明,该方法优于仅在目标分辨率下合成图像的基线方法,同时降低了每步的计算成本。我们证明,通过在额外的分辨率尺度上叠加卷积可以实现更高分辨率的合成,这与其他需要额外模型进行超分辨率合成的方法形成对比。

关键词

引用

@article{arxiv.2407.06079,
  title  = {Layered Diffusion Model for One-Shot High Resolution Text-to-Image Synthesis},
  author = {Emaad Khwaja and Abdullah Rashwan and Ting Chen and Oliver Wang and Suraj Kothawade and Yeqing Li},
  journal= {arXiv preprint arXiv:2407.06079},
  year   = {2024}
}