将彩票假设成功应用于扩散模型
机器学习
2023-10-31 v1
摘要
尽管扩散模型取得成功,但由于反向过程链条长,其训练与推理开销 notoriously 高昂。与此同时,彩票假设(LTH)声称存在中奖票(即适当剪枝的子网络连同原始权重初始化),在单独训练时可达与原始稠密神经网络相竞争的性能。本工作中,我们首次将 LTH 应用于扩散模型。我们在基准(CIFAR-10、CIFAR-100、MNIST)上的去噪扩散概率模型中经验性地发现了稀疏度 90%–99% 而不损性能的子网络。此外,已有 LTH 工作以跨层统一稀疏度识别子网络。我们观察到同一模型两个中奖票之间的相似性因块而异:具体而言,某模型两个中奖票的上游层往往比下游层更相似。因此,我们提出以沿模型不同层变化的稀疏度寻找中奖票。实验结果表明,我们的方法能找到更稀疏的子模型,所需存储内存更少并降低必要 FLOPs 数量。代码见 https://github.com/osier0524/Lottery-Ticket-to-DDPM。
引用
@article{arxiv.2310.18823,
title = {Successfully Applying Lottery Ticket Hypothesis to Diffusion Model},
author = {Chao Jiang and Bo Hui and Bohan Liu and Da Yan},
journal= {arXiv preprint arXiv:2310.18823},
year = {2023}
}