中文

基于预测潜在表示的视频生成

计算机视觉与模式识别 2026-05-05 v1

摘要

视频变分自编码器(VAE)通过将视觉世界映射到紧凑时空潜在空间,从而实现潜在视频生成建模,提高了训练效率和稳定性。虽然现有的视频 VAE 在复原质量方面取得了可喜的成绩,但持续优化复原并不一定转化为更好的生成性能。如何增强视频潜在表示的可扩散性仍是一个关键且未解决的挑战。本文灵感来自预测世界建模的原理,探讨了预测学习在视频生成建模中的潜力。为此,我们引入一种简单且有效的预测复原目标,将预测学习与视频复原统一。具体而言,我们随机丢弃未来帧仅编码部分过去观察,同时训练解码器以同时重建观察帧和预测未来帧。这种设计鼓励潜在空间编码出时序预测结构并构建对视频动态的更连贯理解,从而提高生成质量。我们的模型称为预测视频 VAE(PV-VAE),在 UCF101 上实现了比 Wan2.2 VAE 52% 更快的收敛速度,并实现了 34.42 的 FVD 改进。此外,全面分析表明,PV-VAE 不仅在可扩展性方面表现优异,随着 VAE 训练,生成性能得到改善;而且在下游视频理解任务中也持续获得收益,凸显其潜在空间有效捕获时序一致性和运动先验。

关键词

引用

@article{arxiv.2605.02134,
  title  = {Video Generation with Predictive Latents},
  author = {Yian Zhao and Feng Wang and Qiushan Guo and Chang Liu and Xiangyang Ji and Jian Zhang and Jie Chen},
  journal= {arXiv preprint arXiv:2605.02134},
  year   = {2026}
}