中文

MTC-VAE:具有内容感知的多级时间压缩

计算机视觉与模式识别 2026-02-03 v1

摘要

潜在视频扩散模型(LVDM)依赖变分自编码器(VAE)将视频压缩为紧凑的潜在表示。对于连续变分自编码器(VAE),实现更高的压缩率是可取的;然而,当在不扩展隐藏通道维度的情况下添加额外采样层时,效率会显著下降。在本文中,我们提出了一种技术,将固定压缩率的VAE转换为支持多级时间压缩的模型,提供了一种直接且最小微调的方法来抵消高压缩率下的性能下降。此外,我们研究了不同压缩级别如何影响模型在具有不同特征的视频片段上的性能,为我们提出的方法的有效性提供了经验证据。我们还研究了将我们的多级时间压缩VAE与基于扩散的生成模型DiT集成,突出了在这些框架内成功的联合训练和兼容性。这项研究展示了多级时间压缩的潜在用途。

关键词

引用

@article{arxiv.2602.01340,
  title  = {MTC-VAE: Multi-Level Temporal Compression with Content Awareness},
  author = {Yubo Dong and Linchao Zhu},
  journal= {arXiv preprint arXiv:2602.01340},
  year   = {2026}
}