层次量化对最优重构是否至关重要?
计算机视觉与模式识别
2026-03-20 v2 机器学习
摘要
向量量化变分自编码器 (VQ-VAEs) 是依赖高重构保真度的模型的核心,从神经压缩到生成式管道均依赖其。层次化扩展,如 VQ-VAE2,常被归因于因分离全局与局部特征在多个层面上实现卓越的重构性能。然而,由于高层次的所有信息都来自低层次,它们不应携带超出低层次已编码的额外重构内容。结合最近在训练目标和量化机制方面的进展,这引发我们提出的问题:在 representational 预算匹配且无 codebook 崩溃的情况下,单层 VQ-VAE 是否可以等于其层次化对手的重构保真度。虽然层次化模型的多尺度结构可能在下游任务中提高感知质量,但层次化对重构精度的影响——从未受 codebook 利用和整体 representational 容量的影响——仍在实证上不充分考察。我们通过在高分辨率 ImageNet 图像上对比两个层次 VQ-VAE 与容量匹配的单层模型来重访此问题。一致于先前观察,我们确认不充分的 codebook 利用限制了单层 VQ-VAEs,且过高维的嵌入会导致量化不稳定并增加 codebook 崩溃。我们表明,轻量级干预如来自数据的初始化、周期性重置不活跃的 codebook 向量以及系统调谐 codebook 超参数显著减少崩溃。我们的结果表明,在 representational 预算匹配且缓解了 codebook 崩溃的情况下,单层 VQ-VAE 可以匹配层次化变体的重构保真度,挑战了层次化量化对高质量重构本质优越性的假设。
关键词
引用
@article{arxiv.2601.22244,
title = {Is Hierarchical Quantization Essential for Optimal Reconstruction?},
author = {Shirin Reyhanian and Laurenz Wiskott},
journal= {arXiv preprint arXiv:2601.22244},
year = {2026}
}
备注
Code available at : https://github.com/wiskott-lab/single-vs-hier-recon