中文

重新思考面向图像合成的向量量化分词器的目标

计算机视觉与模式识别 2023-03-10 v2

摘要

基于向量量化(VQ-based)的生成模型通常由两个基本组件组成,即VQ分词器和生成式transformer。先前的研究侧重于提高VQ分词器的重建保真度,但很少考察重建的改进如何影响生成式transformer的生成能力。在本文中,我们惊讶地发现,提高VQ分词器的重建保真度并不一定能改善生成。相反,在VQ分词器中学习压缩语义特征显著提升了生成式transformer捕捉纹理和结构的能力。因此我们强调了面向图像合成的VQ分词器的两个竞争性目标:语义压缩与细节保留。与以往仅追求更好细节保留的工作不同,我们提出了具有两个学习阶段以平衡这两个目标的Semantic-Quantized GAN(SeQ-GAN)。在第一阶段,我们提出一种语义增强的感知损失以实现更好的语义压缩。在第二阶段,我们固定编码器和码本,但增强并微调解码器以实现更好的细节保留。所提出的SeQ-GAN大幅改进了基于VQ的生成模型,并在无条件与有条件图像生成上超越了GAN和扩散模型(Diffusion Models)。我们的SeQ-GAN(364M)在256x256 ImageNet生成上取得了6.25的Frechet Inception Distance(FID)和140.9的Inception Score(IS),相较VIT-VQGAN(714M)取得的11.2 FID和97.2 IS有显著提升。

关键词

引用

@article{arxiv.2212.03185,
  title  = {Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis},
  author = {Yuchao Gu and Xintao Wang and Yixiao Ge and Ying Shan and Xiaohu Qie and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2212.03185},
  year   = {2023}
}