中文

联合与征服:基于扩散模型即插即用多模态合成

计算机视觉与模式识别 2023-04-21 v2

摘要

生成满足多个约束的照片在内容创作行业有广泛用途。完成此任务的一个关键障碍是需要由所有模态(即约束)及其对应输出组成的配对数据。此外,现有方法为引入新条件需使用跨所有模态的配对数据重新训练。本文提出一种基于去噪扩散概率模型(DDPMs)的该问题解决方案。我们选择扩散模型而非其他生成模型的动机源于其灵活的内部结构。由于DDPM中每个采样步均服从高斯分布,我们表明在给定各种约束下生成图像存在闭式解。我们的方法能联合多个在多个子任务上训练的扩散模型,并通过我们提出的采样策略征服组合任务。我们还引入一种新颖可靠性参数,允许仅在采样时使用跨不同数据集训练的各种现成扩散模型来引导其达到满足多约束的期望结果。我们在多种标准多模态任务上开展实验以证明我们方法的有效性。更多细节见 https://nithin-gk.github.io/projectpages/Multidiff/index.html

关键词

引用

@article{arxiv.2212.00793,
  title  = {Unite and Conquer: Plug & Play Multi-Modal Synthesis using Diffusion Models},
  author = {Nithin Gopalakrishnan Nair and Wele Gedara Chaminda Bandara and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2212.00793},
  year   = {2023}
}

备注

Accepted at CVPR 2023