中文

推进扩散模型:无混叠重采样与增强的旋转等变性

计算机视觉与模式识别 2024-11-15 v1 人工智能 机器学习 图像与视频处理

摘要

图像生成的最新进展,特别是通过扩散模型,已显著提升了图像合成质量。尽管如此,扩散模型仍面临模型诱导伪影和图像保真度稳定性有限的挑战。在本工作中,我们假设这一问题的主要原因是引入混叠的不当重采样操作,而由图像处理理论指导的仔细无混叠重采样可以改善扩散模型在图像合成中的性能。我们提出将无混叠重采样层集成到扩散模型的 UNet 架构中,且不增加额外可训练参数,从而保持计算效率。随后我们评估这些理论驱动的修改是否提升图像质量和旋转等变性。在包括 CIFAR-10、MNIST 和 MNIST-M 在内的基准数据集上的实验结果显示,图像质量持续提升,特别是在 FID 和 KID 分数方面。此外,我们提出了一种修改的扩散过程,可在无需额外训练的情况下实现用户控制的生成图像旋转。我们的发现突显了诸如无混叠重采样等理论驱动增强在生成模型中提升图像质量同时保持模型效率的潜力,并为将其纳入视频生成扩散模型开辟了未来研究方向,从而更深入地探索无混叠重采样在生成建模中的应用。

关键词

引用

@article{arxiv.2411.09174,
  title  = {Advancing Diffusion Models: Alias-Free Resampling and Enhanced Rotational Equivariance},
  author = {Md Fahim Anjum},
  journal= {arXiv preprint arXiv:2411.09174},
  year   = {2024}
}

备注

13 pages, 7 figures