中文

VidTwin:解耦结构与动力学的视频 VAE

计算机视觉与模式识别 2025-03-31 v2 人工智能 机器学习

摘要

近期视频自编码器 (Video AEs) 的发展显著提高了视频生成的质量和效率。本文提出一种新型且紧凑的视频自编码器,VidTwin,通过将视频解耦分为两个独立的潜在空间:结构潜在向量捕获整体内容和全局运动,而动力学潜在向量则代表细粒度细节和快速运动。具体而言,我们的方法利用编码器-解码器主干网络,辅以两个子模块分别提取这两个潜在空间。第一个子模块采用 Q-Former 提取低频运动趋势,随后通过下采样块消除冗余的内容细节。第二个子模块沿空间维度平均潜在向量,以捕获快速运动。大量实验表明,VidTwin 实现了 0.20% 的极高压缩率,同时在 MCL-JCV 数据集上 achieves 28.14 的高质量复原 (PSNR),在下游生成任务中表现出色。此外,我们的模型展现了可解释性和可扩展性,为未来的视频潜在表征和生成研究铺平了道路。更多细节请访问我们的项目页面:https://vidtwin.github.io/。

关键词

引用

@article{arxiv.2412.17726,
  title  = {VidTwin: Video VAE with Decoupled Structure and Dynamics},
  author = {Yuchi Wang and Junliang Guo and Xinyi Xie and Tianyu He and Xu Sun and Jiang Bian},
  journal= {arXiv preprint arXiv:2412.17726},
  year   = {2025}
}

备注

Accepted by CVPR 2025; Project page: https://vidtwin.github.io/; Code: https://github.com/microsoft/VidTok/tree/main/vidtwin