通过截断 Karhunen-Loève 展开实现高效扩散模型训练
计算机视觉与模式识别
2025-07-01 v2
摘要
扩散去噪模型已成为图像生成的流行方法,但通常在训练过程中 suffer于收敛缓慢。在本文中,我们识别到这种收敛缓慢部分原因在于驱动前向过程的布朗运动的复杂性。为此,我们采用 Karhunen-Loève 展开表示布朗运动,并将其截断为有限个本征函数。我们提出了一种带有增广随机初始值的新型常微分方程,称为 KL 扩散,作为训练和采样的新型前向过程。通过开发合适的去噪损失函数,我们将 KL 扩散集成到现有的去噪式模型中。以广泛采用的 DDIM 框架为基准,确保公平比较,因为我们的修改仅限于前向过程和损失函数,网络结构和采样方法保持不变。我们的方法显著优于基准扩散模型,实现了收敛速度是基准模型的两倍即可获得最佳 FID 分数,从而最终获得更低的 FID 分数。值得注意的是,我们的方法实现了高度并行化计算,无需额外的可学习参数,并且可以灵活地集成到现有的扩散方法中。代码将公开发布。
引用
@article{arxiv.2503.17657,
title = {Efficient Diffusion Training through Parallelization with Truncated Karhunen-Lo\`eve Expansion},
author = {Yumeng Ren and Yaofang Liu and Aitor Artola and Laurent Mertz and Raymond H. Chan and Jean-michel Morel},
journal= {arXiv preprint arXiv:2503.17657},
year = {2025}
}
备注
12 pages, 9 figures