引导稀疏扩散模型
计算机视觉与模式识别
2026-05-27 v2
摘要
扩散模型在图像合成方面取得了高质量,但在训练和推理期间仍然昂贵。最近的研究利用了视觉内容中固有的冗余性,通过仅在子集上训练来降低训练成本。虽然这些方法在提供更经济且更有效的训练方面取得了成功,但稀疏训练的扩散模型在推理时仍感力不够。这源于它们缺乏对分类器自由指导(Classifier-free Guidance, CFG)的响应,导致推理时性能不佳。为克服此问题,我们提出了稀疏指导(Sparse Guidance, SG)。不使用条件丢弃作为指导扩散模型的信号,SG使用基于标记的稀疏性。结果,SG更好地保留了条件预测的高方差,实现了良好的质量和高方差输出。利用推理时的基于标记的稀疏性,SG在更低的计算成本下实现了更高的保真度,在常用的ImageNet-256基准上实现1.58 FID,FLOPs减少25%,在匹配基线质量时可实现最高58%的FLOP节省。为演示稀疏指导的有效性,我们训练了一个2.5B参数的文本到图像扩散模型,在训练时使用稀疏性,在推理时利用SG。SG在构图和人类偏好得分方面实现了改进,同时提高了吞吐量。
关键词
引用
@article{arxiv.2601.01608,
title = {Guiding Token-Sparse Diffusion Models},
author = {Felix Krause and Stefan Andreas Baumann and Johannes Schusterbauer and Olga Grebenkova and Ming Gui and Vincent Tao Hu and Björn Ommer},
journal= {arXiv preprint arXiv:2601.01608},
year = {2026}
}