统一扩散模型的潜在空间及其在 CycleDiffusion 和引导中的应用
计算机视觉与模式识别
2022-12-08 v2 图形学
机器学习
摘要
扩散模型在生成建模中取得了前所未有的性能。通常采用的扩散模型潜在编码的表述是一系列逐步去噪的样本,这与 GAN、VAE 和归一化流的更简单的(例如,高斯)潜在空间相反。本文提供了各种扩散模型潜在空间的一种替代性高斯表述,以及一个将图像映射到潜在空间的可逆 DPM-Encoder。虽然我们的表述纯粹基于扩散模型的定义,但我们展示了几个有趣的结果。(1) 经验上,我们观察到在相关领域上独立训练的两个扩散模型中会出现一个共同的潜在空间。基于这一发现,我们提出了 CycleDiffusion,它使用 DPM-Encoder 进行非配对图像到图像转换。此外,将 CycleDiffusion 应用于文本到图像扩散模型,我们表明大规模文本到图像扩散模型可以用作零样本图像到图像编辑器。(2) 人们可以通过在基于能量模型的统一即插即用表述中控制潜在编码,来引导预训练的扩散模型和 GAN。使用 CLIP 模型和一个人脸识别模型作为引导,我们证明了与 GAN 相比,扩散模型对低密度子群和个体具有更好的覆盖率。代码公开于 https://github.com/ChenWu98/cycle-diffusion。
引用
@article{arxiv.2210.05559,
title = {Unifying Diffusion Models' Latent Space, with Applications to CycleDiffusion and Guidance},
author = {Chen Henry Wu and Fernando De la Torre},
journal= {arXiv preprint arXiv:2210.05559},
year = {2022}
}