中文

跨模态视频 VAE 的大位移视频自动编码

计算机视觉与模式识别 2024-12-24 v1

摘要

学习鲁棒的视频变分自编码器(VAE)对于减少视频冗余度和促进高效视频生成至关重要。直接将图像 VAE 应用于单个帧的孤立处理会导致时序不一致和次优压缩率,因缺乏时序压缩。现有的视频 VAE 已开始解决时序压缩,但往往 suffers from 重建性能不足。本文提出一种新型且强大的视频自编码器,实现高保真视频编码。首先,我们观察到仅将图像 VAE 扩展为 3D VAE 以实现时空压缩会引入运动模糊和细节失真伪影。因此,我们提出时序感知的空间压缩,以更好地编码和解码空间信息。此外,我们整合轻量级运动压缩模型以进一步进行时序压缩。其次,我们提出利用文本到视频数据集中固有的文本信息,并将文本引导纳入模型。这显著提升了重建质量,尤其在细节保留和时序稳定性方面。最后,通过在图像和视频上联合训练进一步提升模型的通用性,不仅提升重建质量,还使模型能够执行图像和视频自编码。广泛评估表明,我们的方法在与强大的近期基线方法的比较中表现卓越。项目网站可在 https://yzxing87.github.io/vae/ 查找。

关键词

引用

@article{arxiv.2412.17805,
  title  = {Large Motion Video Autoencoding with Cross-modal Video VAE},
  author = {Yazhou Xing and Yang Fei and Yingqing He and Jingye Chen and Jiaxin Xie and Xiaowei Chi and Qifeng Chen},
  journal= {arXiv preprint arXiv:2412.17805},
  year   = {2024}
}

备注

Project Website: https://yzxing87.github.io/vae/