中文

针对大幅变化帧自然视频的真实感视频预测

计算机视觉与模式识别 2020-03-20 v1 图像与视频处理

摘要

深度学习的近期进展显著提升了视频预测的性能。然而,最先进的方法在其未来预测中仍受模糊与失真困扰,尤其当帧间存在大幅运动时。为解决这些问题,我们提出了一种具有分层架构的深度残差网络,其中每一层在不同空间分辨率下预测未来状态,且不同层的预测通过自顶向下连接融合以生成未来帧。我们使用对抗损失与感知损失函数训练模型,并在车载摄像头采集的自然视频数据集上进行了评估。我们的模型在大幅与小幅变化帧的视频序列未来帧预测上,定量优于最先进的基线方法。此外,我们的模型生成的未来帧具有更精细的细节与纹理,在感知上比基线更为真实,尤其在快速相机运动下。

关键词

引用

@article{arxiv.2003.08635,
  title  = {Photo-Realistic Video Prediction on Natural Videos of Largely Changing Frames},
  author = {Osamu Shouno},
  journal= {arXiv preprint arXiv:2003.08635},
  year   = {2020}
}

备注

16 pages, 7 figures