动态双输出扩散模型
计算机视觉与模式识别
2022-03-16 v2 图像与视频处理
摘要
基于迭代去噪的生成方法,又称去噪扩散模型,近来被证明在质量上与其他类生成模型相当甚至超越,特别是目前在图像生成许多子任务中最先进的生成对抗网络(GAN)。然而,该方法的一个主要缺点是需数百次迭代才能产生有竞争力的结果。近期工作提出了允许以更少迭代加速生成的方案,但随着生成中应用的迭代越来越少,图像质量逐渐恶化。在本文中,我们揭示了影响扩散模型生成质量的部分原因,尤其在少迭代采样时,并给出了一个简单却有效的缓解方案。我们考虑两种相反的迭代去噪方程,第一种预测所加噪声,第二种直接预测图像。我们的方案取两者并学习在去噪过程中动态切换。我们提出的方案具有通用性,可应用于任何现有扩散模型。如我们所展示的,当应用于各种 SOTA 架构时,我们的方案立即提升了其生成质量,且增加的复杂度和参数可忽略。我们在多个数据集和配置上实验,并进行了广泛的消融研究以支持这些发现。
引用
@article{arxiv.2203.04304,
title = {Dynamic Dual-Output Diffusion Models},
author = {Yaniv Benny and Lior Wolf},
journal= {arXiv preprint arXiv:2203.04304},
year = {2022}
}
备注
To be presented at CVPR 2022