KOALA:面向文本到图像合成中内存高效与快速扩散模型的实证经验
计算机视觉与模式识别
2024-11-26 v3 人工智能
摘要
随着文本到图像(T2I)合成模型规模的增大,它们需要更高的推理成本,因为需要具有更大内存的更昂贵的 GPU,这使得重现这些模型具有挑战性,此外训练数据集的访问也受到限制。我们的研究旨在降低这些推理成本,并探索仅使用公开可用的数据集和开源模型,T2I 模型的生成能力可以被扩展到何种程度。为此,通过使用事实上的标准文本到图像模型 Stable Diffusion XL (SDXL),我们提出了构建高效 T2I 模型的三个关键实践:(1)知识蒸馏:我们探索如何有效地将 SDXL 的生成能力蒸馏到高效的 U-Net 中,并发现自注意力是最关键的部分。(2)数据:尽管样本较少,但具有丰富描述的高分辨率图像比大量具有简短描述的低分辨率图像更为关键。(3)教师模型:步数蒸馏教师模型允许 T2I 模型减少加噪步骤。基于这些发现,我们构建了两种高效的文本到图像模型,称为 KOALA-Turbo 和 KOALA-Lightning,它们具有两个紧凑的 U-Net(1B 和 700M),将模型尺寸缩小至 SDXL U-Net 的 54% 和 69%。特别是,KOALA-Lightning-700M 比 SDXL 快 4 倍,同时仍保持令人满意的生成质量。此外,与 SDXL 不同,我们的 KOALA 模型可以在具有 8GB VRAM (3060Ti) 的消费级 GPU 上生成 1024px 的高分辨率图像。我们相信,我们的 KOALA 模型将产生重大的实际影响,作为资源受限环境中学术研究人员和普通用户的 SDXL 的经济高效替代方案。
引用
@article{arxiv.2312.04005,
title = {KOALA: Empirical Lessons Toward Memory-Efficient and Fast Diffusion Models for Text-to-Image Synthesis},
author = {Youngwan Lee and Kwanyong Park and Yoorhim Cho and Yong-Ju Lee and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2312.04005},
year = {2024}
}
备注
NeurIPS 2024