高效裁剪文本到图像模型:基于 Stable Diffusion 的裁剪洞察
计算机视觉与模式识别
2024-11-25 v1 人工智能
计算与语言
机器学习
摘要
随着文本到图像模型在功能方面的不断提升,其日益庞大的规模正在成为在资源受限设备上广泛采用的重大障碍。本文提出了一种针对 Stable Diffusion 2 的后训练裁剪研究,这是文本到图像领域模型压缩的关键需求。我们的研究针对尚未探索的多模态生成模型进行裁剪技术,尤其关注文本组件和图像生成组件的裁剪影响的独立性。我们对在各种稀疏度下裁剪整个模型或模型单个组件进行了全面比较。我们的结果yield了此前未记录的发现。例如,与语言模型裁剪中既定趋势相反,我们发现简单的数值裁剪在文本到图像上下文中优于更高级的技术。此外,我们的结果显示,Stable Diffusion 2 可被裁剪至 38.5% 的稀疏度,同时几乎没有损失质量,实现了显著的模型规模减小。我们提出了一种最佳裁剪配置,将文本编码器裁剪至 47.5%,将扩散生成器裁剪至 35%。该配置在保持图像生成质量的同时,显著减少了计算要求。此外,我们的工作揭示了关于文本到图像模型中信息编码的有趣问题:我们观察到,在超过特定阈值后的裁剪会导致性能骤降(不可读图像),这表明特定权重可能编码了关键语义信息。这为模型压缩、互操作性和偏见识别在文本到图像模型方面的未来研究开辟了新方向。通过提供对文本到图像模型裁剪行为的至关重要见解,本研究为开发更高效和更可及的 AI 驱动图像生成系统奠定了基础。
关键词
引用
@article{arxiv.2411.15113,
title = {Efficient Pruning of Text-to-Image Models: Insights from Pruning Stable Diffusion},
author = {Samarth N Ramesh and Zhixue Zhao},
journal= {arXiv preprint arXiv:2411.15113},
year = {2024}
}