基于离散扩散与矢量量化建模中全局上下文的图像生成方法
计算机视觉与模式识别
2024-03-01 v1 机器学习
摘要
将矢量量化变分自编码器(VQ-VAE)与自回归模型作为生成部分相结合,在图像生成上取得了高质量结果。然而,自回归模型在采样阶段会严格遵循渐进式扫描顺序。这导致现有VQ系列模型难以摆脱缺乏全局信息的困境。连续域中的去噪扩散概率模型(DDPM)已展现出捕捉全局上下文并生成高质量图像的能力。在离散状态空间中,一些工作已展示出执行文本生成和低分辨率图像生成的潜力。我们表明,借助VQ-VAE中富含内容的离散视觉码本,离散扩散模型也能生成具有全局上下文的高保真图像,弥补了经典自回归模型在像素空间上的不足。同时,离散VAE与扩散模型的结合解决了传统自回归模型体积过大的缺点,以及扩散模型在生成图像时采样过程耗时过多的缺点。研究发现,生成图像的质量高度依赖于离散视觉码本。大量实验表明,所提出的矢量量化离散扩散模型(VQ-DDM)能够以低复杂度取得与顶级方法相当的性能。在无额外训练的情况下,其在图像修复任务上也展现出相对于其他矢量量化结合自回归模型的明显优势。
引用
@article{arxiv.2112.01799,
title = {Global Context with Discrete Diffusion in Vector Quantised Modelling for Image Generation},
author = {Minghui Hu and Yujie Wang and Tat-Jen Cham and Jianfei Yang and P. N. Suganthan},
journal= {arXiv preprint arXiv:2112.01799},
year = {2024}
}