并非所有图像区域都重要:用于自回归图像生成的掩码矢量量化
计算机视觉与模式识别
2023-05-24 v1
摘要
现有自回归模型遵循两阶段生成范式:首先在潜空间学习用于图像重建的码本,然后基于所学码本自回归地完成图像生成。然而,现有码本学习不加区分地建模图像所有局部区域信息,而不考虑其不同的感知重要性,这给所学码本带来冗余,不仅限制了下一阶段自回归模型对重要结构的建模能力,还导致高训练成本与慢生成速度。本研究借鉴经典图像编码理论中的重要性感知思想,提出一种由掩码量化 VAE(MQ-VAE)与 Stackformer 组成的新颖两阶段框架,使模型免于建模冗余。具体地,MQ-VAE 在量化前引入自适应掩码模块以掩盖冗余区域特征,并在量化后引入自适应解掩码模块恢复原始网格图像特征图以忠实重建原图。随后,Stackformer 学习预测下一码及其在特征图中位置的组合。在多种图像生成上的综合实验验证了我们的有效性与高效性。代码将发布于 https://github.com/CrossmodalGroup/MaskedVectorQuantization。
引用
@article{arxiv.2305.13607,
title = {Not All Image Regions Matter: Masked Vector Quantization for Autoregressive Image Generation},
author = {Mengqi Huang and Zhendong Mao and Quan Wang and Yongdong Zhang},
journal= {arXiv preprint arXiv:2305.13607},
year = {2023}
}
备注
accepted by CVPR 2023