中文

统一直接去噪:适用于方差保持和方差爆炸扩散模型

计算机视觉与模式识别 2024-06-03 v1

摘要

先前的工作已经证明,在方差保持(VP)场景下,新兴的直接去噪扩散模型(DDDM)可以一步生成高质量图像,同时在多步采样中实现更好的性能。然而,DDDM中使用的伪LPIPS损失引发了关于评估偏差的担忧。在这里,我们提出了一个统一的DDDM(uDDDM)框架,该框架可以在方差保持(VP)和方差爆炸(VE)情况下一步/多步生成图像。我们提供了模型解路径存在性和唯一性以及采样路径不相交性质的理论证明。此外,我们提出了一种自适应伪Huber损失函数,以平衡收敛到真实解和收敛过程的稳定性。通过全面评估,我们证明uDDDM在CIFAR-10上实现了与最佳方法相当的FID分数,无论是VP还是VE。具体来说,uDDDM在CIFAR10上一步生成,VE和VP的FID分别为2.63和2.53。通过将采样扩展到1000步,我们进一步将VE和VP的FID分数分别降低到1.71和1.65,在这两种情况下都达到了最先进的性能。

关键词

引用

@article{arxiv.2405.21059,
  title  = {Unified Directly Denoising for Both Variance Preserving and Variance Exploding Diffusion Models},
  author = {Jingjing Wang and Dan Zhang and Feng Luo},
  journal= {arXiv preprint arXiv:2405.21059},
  year   = {2024}
}