中文

MSPred:基于层次循环网络的多时空尺度视频预测

计算机视觉与模式识别 2022-11-10 v4 机器人学

摘要

自主系统不仅需要理解当前环境,还应能基于过去状态(例如捕获的相机帧)预测未来动作。然而,现有模型主要关注短时间范围内的未来视频帧预测,因此对长期动作规划用途有限。我们提出多尺度层次预测(MSPred),一种新颖的视频预测模型,能够同时在不同时空尺度上预测不同粒度层级的未来可能结果。通过结合空间与时间下采样,MSPred 高效预测人体姿态或位置等抽象表示于长时间范围,同时在视频帧预测上保持有竞争力的性能。在我们的实验中,我们证明 MSPred 在装箱与动作识别数据集上准确预测未来视频帧以及高层表示(如关键点或语义),并持续优于流行的未来帧预测方法。此外,我们对 MSPred 中的不同模块与设计选择进行消融实验,经验性验证了结合不同空间与时间粒度的特征可带来更优性能。用于复现实验的代码与模型见 https://github.com/AIS-Bonn/MSPred。

关键词

引用

@article{arxiv.2203.09303,
  title  = {MSPred: Video Prediction at Multiple Spatio-Temporal Scales with Hierarchical Recurrent Networks},
  author = {Angel Villar-Corrales and Ani Karapetyan and Andreas Boltres and Sven Behnke},
  journal= {arXiv preprint arXiv:2203.09303},
  year   = {2022}
}