基于去噪扩散概率模型的多模态先验图像生成
计算机视觉与模式识别
2022-06-13 v1
摘要
多模态先验下的图像合成是一项有用且具有挑战性的任务,近年来受到越来越多的关注。使用生成模型完成该任务的一个主要挑战是缺乏包含所有模态(即先验)及相应输出的配对数据。在近期工作中,一种变分自编码器(VAE)模型以弱监督方式训练以应对该挑战。由于 VAE 的生成能力通常有限,该方法难以合成属于复杂分布的图像。为此,我们提出一种基于去噪扩散概率模型的方案,以在多模型先验下合成图像。基于扩散模型中每个时间步上的分布为高斯分布这一事实,我们在本工作中证明,存在生成对应于给定模态图像的闭式表达式。所提方案无需针对所有模态显式重训练,并可利用各单独模态的输出根据不同约束生成逼真图像。我们在两个真实世界数据集上开展研究以证明方法的有效性。
引用
@article{arxiv.2206.05039,
title = {Image Generation with Multimodal Priors using Denoising Diffusion Probabilistic Models},
author = {Nithin Gopalakrishnan Nair and Wele Gedara Chaminda Bandara and Vishal M Patel},
journal= {arXiv preprint arXiv:2206.05039},
year = {2022}
}