用于一次性高分辨率文本到图像合成的分层扩散模型
计算机视觉与模式识别
2024-07-09 v1 人工智能
摘要
我们提出了一种一次性文本到图像扩散模型,该模型能够从自然语言描述生成高分辨率图像。我们的模型采用分层U-Net架构,可同时在多个分辨率尺度上合成图像。我们表明,该方法优于仅在目标分辨率下合成图像的基线方法,同时降低了每步的计算成本。我们证明,通过在额外的分辨率尺度上叠加卷积可以实现更高分辨率的合成,这与其他需要额外模型进行超分辨率合成的方法形成对比。
引用
@article{arxiv.2407.06079,
title = {Layered Diffusion Model for One-Shot High Resolution Text-to-Image Synthesis},
author = {Emaad Khwaja and Abdullah Rashwan and Ting Chen and Oliver Wang and Suraj Kothawade and Yeqing Li},
journal= {arXiv preprint arXiv:2407.06079},
year = {2024}
}