MotionRNN:一种用于具有时空变化运动的视频预测的灵活模型
计算机视觉与模式识别
2021-07-09 v3
摘要
本文从预测跨空间与时间不断变化的时空变化运动这一新维度来处理视频预测问题。先前的方法主要捕捉时间状态转移,却忽视了运动本身复杂的时空变化,使其难以适应持续变化的运动。我们观察到物理世界运动可分解为瞬态变化与运动趋势,而后者可视为先前运动的累积。因此,同时捕捉瞬态变化与运动趋势是使时空变化运动更具可预测性的关键。基于这些观察,我们提出 MotionRNN 框架,其可捕捉运动中的复杂变化并适应时空变化场景。MotionRNN 有两个主要贡献。其一是我们设计了 MotionGRU 单元,能以统一方式建模瞬态变化与运动趋势。其二是我们将 MotionGRU 应用于基于 RNN 的预测模型,并给出了一种带有 Motion Highway 的灵活视频预测新架构,可显著提升预测易变运动的能力,并避免多层堆叠预测模型中的运动消失。该框架具有高灵活性,可适配一系列确定性时空预测模型。我们的 MotionRNN 在三个具时空变化运动的视频预测挑战性基准上取得了显著改进。
引用
@article{arxiv.2103.02243,
title = {MotionRNN: A Flexible Model for Video Prediction with Spacetime-Varying Motions},
author = {Haixu Wu and Zhiyu Yao and Jianmin Wang and Mingsheng Long},
journal= {arXiv preprint arXiv:2103.02243},
year = {2021}
}