Flexiffusion:面向灵活去噪计划的分段神经网络搜索
计算机视觉与模式识别
2025-06-09 v2
摘要
扩散模型是一种能够产生多样化高质量图像的前沿生成模型。尽管其有效性显著,但由于大量顺序去噪步骤以及每个步骤的高推理成本,这些模型往往需要巨大的计算资源。最近,神经网络搜索(Neural Architecture Search, NAS)技术被用于自动搜索更快的生成过程。然而,针对扩散模型的 NAS 由于需要评估数千个扩散模型来搜索最优模型而导致搜索成本极高。本文引入 Flexiffusion,这是一种 novel training-free( novel 无训练)NAS 范式,通过同时优化生成步骤和网络结构来加速扩散模型。具体而言,我们将生成过程划分为等距 step 段(等距 step 段),每个段依次由 full step( full 步骤)、多个 partial step(多个 partial 步骤)和若干 null step(若干 null 步骤)组成。full step 计算所有网络模块,partial step 涉及部分模块,null step 则不进行任何计算。Flexiffusion 自主探索每个段的灵活 step 组合,从而大幅降低搜索成本,并实现比扩散模型当前最先进方法(SOTA)更大的加速。我们搜索得到的模型对原始 LDM-4-G 和 SOTA 分别实现了 和 的加速因子。对于 Stable Diffusion V1.5 和 SOTA,分别为 和 。我们还在多个数据集上验证了 Flexiffusion 的性能,实验结果表明 Flexiffusion 能够有效减少扩散模型中的冗余。
引用
@article{arxiv.2409.17566,
title = {Flexiffusion: Segment-wise Neural Architecture Search for Flexible Denoising Schedule},
author = {Hongtao Huang and Xiaojun Chang and Lina Yao},
journal= {arXiv preprint arXiv:2409.17566},
year = {2025}
}