中文

并非所有提示都一样:基于提示的文本到图像扩散模型剪枝

计算机视觉与模式识别 2025-02-12 v3 机器学习

摘要

文本到图像(T2I)扩散模型已展现出惊人的图像生成能力,但其计算密集性阻碍了资源受限的组织在针对内部目标数据进行微调后部署。虽然剪枝技术可作为减轻 T2I 模型计算负担的潜在解决方案,但静态剪枝方法为所有输入提示使用相同的被剪枝模型,忽略了不同提示所需的计算容量差异。动态剪枝通过为每个提示分配独立子网络来解决此问题,但会阻止 GPU 上的批处理并行。为克服这些限制,我们引入自适应提示定制剪枝(APTP),这是一种为 T2I 扩散模型设计的新型提示基剪枝方法。我们方法的核心是提示路由模型,它学习确定输入文本提示所需的计算容量,并根据总体计算预算分配给提示路由到架构代码。每个架构代码代表一个针对分配给它的提示定制的专用模型,代码的数量是一个超参数。我们采用对比学习训练提示路由器和架构代码,确保相似的提示被映射到相邻的代码。进一步,我们采用最优传输技术防止代码坍缩为单一代码。我们通过在 CC3M 和 COCO 上对 Stable Diffusion(SD) V2.1 进行剪枝来展示 APTP 的有效性。APTP 在 FID、CLIP 和 CMMD 分数方面优于单模型剪枝基线。我们对 APTP 学习的聚类进行分析,发现其具有语义意义。我们还展示了 APTP 能够自动发现之前经验上发现的困难提示,例如用于生成文本图像的提示,并将其分配给更高容量的代码。

关键词

引用

@article{arxiv.2406.12042,
  title  = {Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion Models},
  author = {Alireza Ganjdanesh and Reza Shirkavand and Shangqian Gao and Heng Huang},
  journal= {arXiv preprint arXiv:2406.12042},
  year   = {2025}
}