迈向精确图像编码:基于动态向量量化的改进自回归图像生成
计算机视觉与模式识别
2023-05-22 v1
摘要
现有基于向量量化 (VQ) 的自回归模型遵循两阶段生成范式:先学习码本将图像编码为离散码,再基于所学码本完成生成。然而,它们将固定尺寸图像区域编码为定长码,忽略其天然不同的信息密度,导致重要区域编码不足而不重要区域冗余,最终降低生成质量与速度。此外,定长编码导致不自然的光栅扫描自回归生成。为解决该问题,我们提出新颖两阶段框架:(1) 动态量化 VAE (DQ-VAE),依据图像区域信息密度将其编码为变长码,实现准确紧凑的码表示。(2) DQ-Transformer,由此通过新颖堆叠 transformer 架构及共享内容、非共享位置输入层设计,交替建模各粒度码的位置与内容,从粗粒度(少码平滑区)到细粒度(多码细节区)自回归生成图像。各类生成任务上的综合实验验证了我们在效果与效率上的优势。代码将发布于 https://github.com/CrossmodalGroup/DynamicVectorQuantization。
引用
@article{arxiv.2305.11718,
title = {Towards Accurate Image Coding: Improved Autoregressive Image Generation with Dynamic Vector Quantization},
author = {Mengqi Huang and Zhendong Mao and Zhuowei Chen and Yongdong Zhang},
journal= {arXiv preprint arXiv:2305.11718},
year = {2023}
}
备注
CVPR 2023