Wuerstchen:一种面向大规模文本到图像扩散模型的高效架构
计算机视觉与模式识别
2024-05-31 v2
摘要
我们介绍了 Würstchen,一种用于文本到图像合成的新颖架构,它将对标性能与大规模文本到图像扩散模型前所未有的成本效益相结合。我们工作的一个关键贡献是开发了一种潜在扩散技术,其中我们学习了一种详细但极度紧凑的语义图像表示,用于引导扩散过程。与语言的潜在表示相比,这种高度压缩的图像表示为我们提供了更详细的引导,这显著降低了实现 SOTA 结果所需的计算资源。我们的方法还基于用户偏好研究改进了文本条件图像生成的质量。我们方法的训练需求为 24,602 A100-GPU 小时——相比之下 Stable Diffusion 2.1 为 200,000 GPU 小时。我们的方法还需要更少的训练数据来达到这些结果。此外,我们紧凑的潜在表示使我们能够以两倍以上的速度进行推理,在不影响最终性能的情况下,显著削减 SOTA 扩散模型通常的成本和碳足迹。在与 SOTA 模型的更广泛比较中,我们的方法效率显著提高,并且在图像质量方面表现有利。我们相信,这项工作促使人们更加重视性能和计算可及性两者的优先排序。
引用
@article{arxiv.2306.00637,
title = {Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models},
author = {Pablo Pernias and Dominic Rampas and Mats L. Richter and Christopher J. Pal and Marc Aubreville},
journal= {arXiv preprint arXiv:2306.00637},
year = {2024}
}
备注
Corresponding to "W\"urstchen v2"