中文

VP-VAE:通过自适应向量扰动重新思考向量量化

机器学习 2026-02-20 v1 人工智能

摘要

向量量化变分自编码器 (VQ-VAEs) 是现代生成模型的基本工具,但常因表示学习与离散码本优化的内在耦合而导致训练不稳定和"码本坍缩"。本文提出了 VP-VAE (Vector Perturbation VAE),一种新颖的范式,通过消除对训练期间显式码本的需求来实现表示学习与离散化的解耦。我们的关键洞察是,从神经网络的角度来看,执行量化主要表现为在潜空间中注入结构化扰动。因此,VP-VAE 用分布一致且尺度自适应的潜空间扰动取代非可微的量化器,这些扰动通过 Metropolis--Hastings 采样生成。该设计在无需码本的情况下实现稳定训练,同时使模型对推断时量化误差具有鲁棒性。此外,在假设潜变量近似均匀分布的前提下,我们推导出 FSP (Finite Scalar Perturbation),一种轻量级的 VP-VAE 变体,为 FSQ 风格的固定量化器提供统一的理论解释和实际改进。大量实验在图像和音频基准上表明,VP-VAE 和 FSP 在重建保真度方面取得改进,实现了更均衡的 token 使用,同时避免了耦合码本训练的不稳定性。

关键词

引用

@article{arxiv.2602.17133,
  title  = {VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation},
  author = {Linwei Zhai and Han Ding and Mingzhi Lin and Cui Zhao and Fei Wang and Ge Wang and Wang Zhi and Wei Xi},
  journal= {arXiv preprint arXiv:2602.17133},
  year   = {2026}
}