中文

视频序列的未来帧预测

计算机视觉与模式识别 2020-09-04 v1

摘要

预测视频序列的未来帧一直是计算机视觉领域中备受关注的问题,因为它服务于众多应用。预测、预见和推理未来事件的能力是智能的本质,也是人机交互、机器人导航和自动驾驶等决策系统的主要目标之一。然而,该问题的挑战在于其模糊性,因为同一输入视频片段可能存在多个可能的未来序列。朴素设计的模型会将多个可能的未来平均化为单一的模糊预测。近来,两种不同的方法试图解决该问题:(a) 使用表示潜在随机性的潜变量模型,以及 (b) 旨在生成更清晰图像的对抗训练模型。潜变量模型往往难以产生逼真的结果,而对抗训练模型未充分利用潜变量,因此无法产生多样化的预测。这些方法展现出互补的优势与不足。将两种方法结合可产生更逼真且更好覆盖合理未来范围的预测。这构成了本项目工作的研究基础与目标。本文中,我们提出了一种结合两种方法的新型多尺度架构。我们在 Moving MNIST、UCF101 和 Penn Action 数据集上通过一系列实验与经验评估验证了所提模型。我们的方法优于基线方法所得结果。

关键词

引用

@article{arxiv.2009.01689,
  title  = {Future Frame Prediction of a Video Sequence},
  author = {Jasmeen Kaur and Sukhendu Das},
  journal= {arXiv preprint arXiv:2009.01689},
  year   = {2020}
}

备注

Acknowledgement: the contributions, support, and help of Sonam Gupta, PhD Scholar, VPLAB, Deptt. of CS&E, IIT Madras