中文

基于稀疏条件化流匹配的高效视频预测

计算机视觉与模式识别 2023-08-28 v2

摘要

我们提出了一种基于隐空间流匹配的新型视频预测生成模型,它是扩散模型的一种高效替代方案。与先前工作不同,我们通过在图像生成过程的每个积分步仅以一小部分随机过去的帧为条件,将训练和推理期间对过去建模的高昂成本控制在低位。此外,为生成高分辨率视频并加速训练,我们在预训练 VQGAN 的隐空间中进行操作。最后,我们提出用前一噪声帧近似流 ODE 的初始条件。这可减少积分步数,从而在推理时加速采样。我们将该模型称为随机帧条件化流积分视频预测(Random frame conditioned flow Integration for VidEo pRediction),简称 RIVER。我们表明,在常用视频预测基准上,RIVER 取得了优于或媲美先前工作的性能,同时所需计算资源减少一个数量级。

关键词

引用

@article{arxiv.2211.14575,
  title  = {Efficient Video Prediction via Sparsely Conditioned Flow Matching},
  author = {Aram Davtyan and Sepehr Sameni and Paolo Favaro},
  journal= {arXiv preprint arXiv:2211.14575},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Project page: https://araachie.github.io/river