中文

MoVQ:调制量化向量以实现高保真图像生成

计算机视觉与模式识别 2022-09-20 v1

摘要

尽管两阶段向量量化(Vector Quantized, VQ)生成模型能够合成高保真与高分辨率图像,其量化算子会将图像内相似块编码为同一索引,导致现有解码器架构在相邻相似区域产生重复伪影。为解决该问题,我们提出引入空间条件归一化来调制量化向量,从而向嵌入索引图中插入空间变化信息,促使解码器生成更具真实感的图像。此外,我们采用多通道量化以提升离散码的组合能力,且不增加模型与码本开销。另外,为在第二阶段生成离散 token,我们采用掩码生成图像 Transformer(Masked Generative Image Transformer, MaskGIT)来学习压缩潜空间中的底层先验分布,其速度远快于传统自回归模型。在两个基准数据集上的实验表明,我们提出的调制 VQGAN 能够大幅改善重建图像质量,并提供高保真图像生成。

关键词

引用

@article{arxiv.2209.09002,
  title  = {MoVQ: Modulating Quantized Vectors for High-Fidelity Image Generation},
  author = {Chuanxia Zheng and Long Tung Vuong and Jianfei Cai and Dinh Phung},
  journal= {arXiv preprint arXiv:2209.09002},
  year   = {2022}
}