中文

层次化剪枝:大规模扩散模型的位置感知压缩

计算机视觉与模式识别 2026-03-03 v4 人工智能

摘要

最先进的文本到图像扩散模型(DM)在质量方面取得了显著成就,但其庞大的参数规模(8-11B)对于在资源受限的设备上进行推理构成了重大挑战。本文提出了层次化剪枝(HierarchicalPrune),这是一种新颖的压缩框架,基于一个关键观察:扩散模型块 exhibits 不同的功能层次,其中早期块建立语义结构,而后期块处理纹理细化。层次化剪枝综合了三种技术:(1)层次化位置剪枝,基于位置层次识别并删除不essential的后期块;(2)位置权重保留,系统性地保护建立语义结构完整性的早期模型部分;(3)灵敏度引导的蒸馏,根据我们发现的块级灵敏度变化调整知识传递强度。结果,我们的框架将十亿级扩散模型压缩到更适合设备推理的范围,同时保持输出图像的质量。具体而言,结合INT4权重量化,层次化剪枝实现了77.5-80.4%的内存占用减少(例如,从15.8 GB降至3.2 GB)和27.9-38.0%的延迟降低,测量在服务器和消费级GPU上,仅比原始模型下降2.6%的GenEval分数和7%的HPSv2分数。最后,我们的全面用户研究(85名参与者)表明,层次化剪枝在感知质量上与原始模型相当,但显著优于先前工作。

关键词

引用

@article{arxiv.2508.04663,
  title  = {HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models},
  author = {Young D. Kwon and Rui Li and Sijia Li and Da Li and Sourav Bhattacharya and Stylianos I. Venieris},
  journal= {arXiv preprint arXiv:2508.04663},
  year   = {2026}
}

备注

Accepted at AAAI 2026 (Main Technical Track)