中文

动态双输出扩散模型

计算机视觉与模式识别 2022-03-16 v2 图像与视频处理

摘要

基于迭代去噪的生成方法,又称去噪扩散模型,近来被证明在质量上与其他类生成模型相当甚至超越,特别是目前在图像生成许多子任务中最先进的生成对抗网络(GAN)。然而,该方法的一个主要缺点是需数百次迭代才能产生有竞争力的结果。近期工作提出了允许以更少迭代加速生成的方案,但随着生成中应用的迭代越来越少,图像质量逐渐恶化。在本文中,我们揭示了影响扩散模型生成质量的部分原因,尤其在少迭代采样时,并给出了一个简单却有效的缓解方案。我们考虑两种相反的迭代去噪方程,第一种预测所加噪声,第二种直接预测图像。我们的方案取两者并学习在去噪过程中动态切换。我们提出的方案具有通用性,可应用于任何现有扩散模型。如我们所展示的,当应用于各种 SOTA 架构时,我们的方案立即提升了其生成质量,且增加的复杂度和参数可忽略。我们在多个数据集和配置上实验,并进行了广泛的消融研究以支持这些发现。

关键词

引用

@article{arxiv.2203.04304,
  title  = {Dynamic Dual-Output Diffusion Models},
  author = {Yaniv Benny and Lior Wolf},
  journal= {arXiv preprint arXiv:2203.04304},
  year   = {2022}
}

备注

To be presented at CVPR 2022