有限标量量化:简化VQ-VAE
计算机视觉与模式识别
2023-10-13 v2 机器学习
摘要
我们提议用一种称为有限标量量化(FSQ)的简单方案替换VQ-VAE潜表示中的矢量量化(VQ),其中我们将VAE表示投影到少数几个维度(通常少于10)。每个维度被量化到一个小规模的固定值集合,从而通过这些集合的笛卡儿积给出(隐式)码本。通过适当选择维度数以及每维可取的值个数,我们可获得与VQ相同的码本大小。在此类离散表示之上,我们可以训练那些曾在VQ-VAE表示上训练过的相同模型。例如,用于图像生成、多模态生成以及密集预测计算机视觉任务的自回归与掩码Transformer模型。具体而言,我们将FSQ与MaskGIT结合用于图像生成,并与UViM结合用于深度估计、上色与全景分割。尽管FSQ设计简单得多,我们在所有这些任务中均取得了具有竞争力的性能。我们强调,FSQ不会出现码本崩溃,也无需VQ中所用的复杂机制(承诺损失、码本重播种、码分裂、熵惩罚等)来学习具表现力的离散表示。
引用
@article{arxiv.2309.15505,
title = {Finite Scalar Quantization: VQ-VAE Made Simple},
author = {Fabian Mentzer and David Minnen and Eirikur Agustsson and Michael Tschannen},
journal= {arXiv preprint arXiv:2309.15505},
year = {2023}
}
备注
Code: https://github.com/google-research/google-research/tree/master/fsq