中文

使用层级损失进行Stable Diffusion XL的渐进式知识蒸馏

计算机视觉与模式识别 2024-01-08 v1 人工智能

摘要

Stable Diffusion XL (SDXL)因其多功能性和顶级图像质量已成为最佳的开源文本到图像模型。有效解决SDXL模型的计算需求对于更广泛的覆盖和适用性至关重要。在本文中,我们引入了两个缩小版本,Segmind Stable Diffusion (SSD-1B)和Segmind-Vega,分别具有1.3B和0.74B参数的UNet,通过使用层级损失进行渐进式移除来实现,重点是在保持生成质量的同时减小模型大小。我们在https://hf.co/Segmind发布这些模型权重。我们的方法涉及从SDXL的U-Net结构中消除残差网络和Transformer块,从而显著减少参数和延迟。我们的紧凑模型通过利用迁移知识有效模仿原始SDXL,在数十亿参数的SDXL上取得了有竞争力的结果。我们的工作强调了知识蒸馏结合层级损失在减小模型大小的同时保持SDXL高质量生成能力的有效性,从而促进在资源受限环境中的更易部署。

关键词

引用

@article{arxiv.2401.02677,
  title  = {Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss},
  author = {Yatharth Gupta and Vishnu V. Jaddipal and Harish Prabhala and Sayak Paul and Patrick Von Platen},
  journal= {arXiv preprint arXiv:2401.02677},
  year   = {2024}
}