基于稀疏表示的图像生成
计算机视觉与模式识别
2021-03-08 v1 机器学习
摘要
图像的高维特性给基于似然的生成模型带来了架构和采样效率方面的挑战。先前的方法如VQ-VAE使用深度自编码器获得紧凑表示,作为基于似然模型的输入更为实用。我们提出了一种受JPEG等常见图像压缩方法启发的替代方法,将图像转换为量化的离散余弦变换(DCT)块,并将其稀疏表示为DCT通道、空间位置和DCT系数三元组的序列。我们提出了一种基于Transformer的自回归架构,经训练以顺序预测此类序列中下一个元素的条件分布,并能有效扩展到高分辨率图像。在一系列图像数据集上,我们证明了我们的方法可以生成高质量、多样化的图像,其样本度量分数与最先进方法具有竞争力。我们还额外展示了对我们方法的简单修改可产生有效的图像着色和超分辨率模型。
引用
@article{arxiv.2103.03841,
title = {Generating Images with Sparse Representations},
author = {Charlie Nash and Jacob Menick and Sander Dieleman and Peter W. Battaglia},
journal= {arXiv preprint arXiv:2103.03841},
year = {2021}
}