基于残差量化的自回归图像生成
计算机视觉与模式识别
2022-03-10 v2 机器学习
摘要
对于高分辨率图像的自回归(AR)建模,向量量化(VQ)将图像表示为离散码序列。较短的序列长度对 AR 模型而言十分重要,以降低其考虑码的长程交互的计算成本。然而,我们假定先前的 VQ 在率失真权衡方面无法同时缩短码序列并生成高保真图像。在本研究中,我们提出由残差量化 VAE(RQ-VAE)与 RQ-Transformer 组成的两阶段框架,以有效生成高分辨率图像。在给定固定码本大小下,RQ-VAE 可精确逼近图像的特征图,并将图像表示为离散码的堆叠图。随后,RQ-Transformer 通过预测下一堆叠的码来学习预测下一位置的量化特征向量。得益于 RQ-VAE 的精确逼近,我们可以将 256256 图像表示为 88 分辨率的特征图,且 RQ-Transformer 能高效降低计算成本。因此,我们的框架在无条件与有条件图像生成的多个基准上优于现有 AR 模型。我们的方法相比先前 AR 模型在生成高质量图像时还具有显著更快的采样速度。
引用
@article{arxiv.2203.01941,
title = {Autoregressive Image Generation using Residual Quantization},
author = {Doyup Lee and Chiheon Kim and Saehoon Kim and Minsu Cho and Wook-Shin Han},
journal= {arXiv preprint arXiv:2203.01941},
year = {2022}
}
备注
30 pages, 24 figures, accepted by CVPR 2022, the code is available at https://github.com/kakaobrain/rq-vae-transformer