Flexiffusion:用于高效扩散模型的无训练分段式神经架构搜索
计算机视觉与模式识别
2025-06-06 v2 人工智能
摘要
扩散模型(DM)是能够生成高保真图像的强大生成模型,但由于迭代的多步推理而受限于高昂的计算成本。虽然神经架构搜索(NAS)可以优化DM,但现有方法受到重训练需求、逐步优化带来的指数级搜索复杂度以及依赖大量图像生成的缓慢评估的阻碍。为了应对这些挑战,我们提出了Flexiffusion,一个无训练的NAS框架,它在不修改预训练参数的情况下联合优化生成调度和模型架构。我们的核心洞察是将生成过程分解为等长的灵活分段,其中每个分段动态结合三种步骤类型:完整步骤(完整计算)、部分步骤(缓存复用计算)和空步骤(跳过计算)。与逐步NAS相比,这种分段式搜索空间使候选池呈指数级缩小,同时保留了架构多样性。此外,我们引入了相对FID(rFID),一种用于NAS的轻量级评估指标,它测量与教师模型输出而非真实值的偏离程度,将评估时间削减了90%以上。在实践中,Flexiffusion在ImageNet和MS-COCO上的LDM、Stable Diffusion和DDPM中实现了至少2倍的加速,FID退化低于5%,优于先前的NAS和缓存方法。值得注意的是,它在Stable Diffusion上实现了5.1倍的加速,且CLIP分数几乎一致。我们的工作开创了一种在不牺牲质量的情况下搜索高速DM的资源高效范式。
引用
@article{arxiv.2506.02488,
title = {Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models},
author = {Hongtao Huang and Xiaojun Chang and Lina Yao},
journal= {arXiv preprint arXiv:2506.02488},
year = {2025}
}
备注
This paper was intended to be a v2 version of my previous paper (arXiv:2409.17566), but it was submitted as a new paper by mistake