f-DM:基于渐进信号变换的多阶段扩散模型
计算机视觉与模式识别
2022-10-12 v1 机器学习
摘要
扩散模型 (DMs) 最近已成为各个领域生成建模的 SoTA 工具。标准 DM 可以被视为分层变分自编码器 (VAE) 的一种实例化,其中潜变量是从具有固定尺度和方差的以输入为中心的高斯分布中推断出来的。与 VAE 不同,这种表述限制了 DM 改变潜空间和学习抽象表示的能力。在本工作中,我们提出了 f-DM,这是一个允许渐进信号变换的广义 DM 家族。更准确地说,我们扩展了 DM 以纳入一组(手工设计或学习得到的)变换,其中变换后的输入是每个扩散步骤的均值。我们提出了一个广义的表述,推导了相应的去噪目标,并给出了修改后的采样算法。作为演示,我们将 f-DM 应用于图像生成任务,使用了一系列函数,包括下采样、模糊以及基于预训练 VAE 编码器的学习变换。此外,我们指出了在信号被次采样时调整噪声水平的重要性,并提出了一种简单的重缩放方案。f-DM 能够在标准图像生成基准(如 FFHQ、AFHQ、LSUN 和 ImageNet)上生成高质量样本,同时具有更好的效率和语义可解释性。
引用
@article{arxiv.2210.04955,
title = {f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation},
author = {Jiatao Gu and Shuangfei Zhai and Yizhe Zhang and Miguel Angel Bautista and Josh Susskind},
journal= {arXiv preprint arXiv:2210.04955},
year = {2022}
}
备注
28 pages, 21 figures, work in progress