中文

STDiff:用于连续随机视频预测的时空扩散模型

计算机视觉与模式识别 2024-02-20 v1

摘要

预测视频的未来帧具有挑战性,因为难以学习影响其内容的潜在因素的不确定性。在本文中,我们提出了一种新颖的视频预测模型,该模型在时空域上具有无限维潜在变量。具体来说,我们首先分解视频的运动和内容信息,然后采用神经常微分方程来预测时间运动信息,最后,图像扩散模型以预测的运动特征和前一帧为条件,自回归地生成视频帧。我们模型更强的表达能力和更强的随机性学习能力带来了最先进的视频预测性能。同时,我们的模型能够实现时间连续预测,即以无监督的方式预测任意高帧率的未来视频帧。我们的代码可在 \url{https://github.com/XiYe20/STDiffProject} 获取。

关键词

引用

@article{arxiv.2312.06486,
  title  = {STDiff: Spatio-temporal Diffusion for Continuous Stochastic Video Prediction},
  author = {Xi Ye and Guillaume-Alexandre Bilodeau},
  journal= {arXiv preprint arXiv:2312.06486},
  year   = {2024}
}