中文

先连续后离散:无维度坍缩的 VQ-VAE

机器学习 2026-05-13 v2

摘要

虽然许多改进 VQ-VAE 性能的方法集中在码本大小和利用率上,但维度坍缩的影响仍未得到解决,即训练后的 VQ-VAE 表示存在于极低维子空间中(全秩的 1-2%)。我们从理论和经验上证明,维度坍缩导致了一个各种码本改进技术都无法突破的硬损失下界。我们的分析框架通过引入率失真理论的思想,扩展了 Saxe 等人 [2014] 的序列学习效应,并解释了潜在坍缩是如何由 VQ 抑制低方差方向引起的。我们的理论证明了一个简单的解决方案:在引入 VQ 之前,将模型作为(未量化的)自编码器训练的“预热阶段”。在合成实验以及大规模图像 (VQGAN) 和音频 (WavTokenizer) VQ-VAE 上,我们表明 AE Warm-Up 成功恢复了表示维度,从而在相同训练预算下获得了更低的重建损失和感知损失。在码本大小 KK \in {210,214,2162^{10}, 2^{14}, 2^{16}} 的情况下,AE warm-up 将 VQGAN 码本有效维度从 3-5 提高到 17-19,并将 rFID 降低了 17-35%;在 KK \in {213,2142^{13}, 2^{14}} 的 WavTokenizer 上,它将码本维度从 4 提高到 17-19,并将 PESQ 提高了 11-14%。我们经验性地刻画了预热持续时间如何控制可实现的最终损失。与实验一致,我们的理论分析预测了下游性能作为预热长度的函数,从而实现了从 AE Warm-up 到 VQ-VAE 训练切换的自适应准则。

关键词

引用

@article{arxiv.2605.06870,
  title  = {Continuous First, Discrete Later: VQ-VAEs Without Dimensional Collapse},
  author = {Xinyu Zhao and Nikita Karagodin and Hamed Hassani and Sinan Hersek and Paul Pu Liang and Yury Polyanskiy},
  journal= {arXiv preprint arXiv:2605.06870},
  year   = {2026}
}