OneVAE:离散-连续联合优化提升离散视频VAE训练效果
计算机视觉与模式识别
2025-08-14 v1
摘要
将视频编码为离散 token 可与文本 token 对齐,以促进简洁且统一的多模态大语言模型。然而,引入显著的时空压缩,与连续视频表示形成鲜明对比。之前的离散视频 VAE 经历训练不稳定、耗时过长以及重建质量下降的问题。鉴于连续 VAE 的训练更容易且性能更优,直观的想法是通过利用连续 VAE 来增强离散视频 VAE。我们在重新思考离散与连续表示内在联系后,发现 FSQ 能有效地保留预训练的连续 VAE 先验,而其他量化方法则不行。通过利用连续 VAE 先验,我们比从零训练快几个数量级,并在收敛时实现更佳性能。同时,提出了两个结构性改进。首先,受连续 VAE 通过扩大潜在维度来增强重建的方式启发,我们引入多 token 量化机制,在不牺牲 token 压缩比的前提下, nearly 降低约 1 dB 的 PSNR。其次,针对高压缩比视频 VAE 的重建挑战,我们加强了首帧重建,使因果 VAE 能够利用此信息来增强后续帧的表现,显著提升了 4x16x16 离散 VAE 的性能。进一步地,我们提出一种联合离散-连续优化方案,将两种范式统一于单个网络中,首次实现在单一网络中同时在连续和离散表示上取得竞争性能。我们将该方法命名为 OneVAE,以反映其本质。
引用
@article{arxiv.2508.09857,
title = {OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better},
author = {Yupeng Zhou and Zhen Li and Ziheng Ouyang and Yuming Chen and Ruoyi Du and Daquan Zhou and Bin Fu and Yihao Liu and Peng Gao and Ming-Ming Cheng and Qibin Hou},
journal= {arXiv preprint arXiv:2508.09857},
year = {2025}
}