中文

ContextVP:全上下文感知视频预测

计算机视觉与模式识别 2018-09-11 v3

摘要

基于卷积网络、循环网络及其组合的视频预测模型常导致模糊预测。我们确定了导致不精确预测的一个重要因素,该因素在文献中未被充分研究:盲点,即缺乏访问所有相关过去信息以准确预测未来。为解决此问题,我们引入了一种全上下文感知架构,使用并行多维LSTM单元捕获每个像素的整个可用过去上下文,并使用混合单元聚合它。我们的模型优于一个由20个循环卷积层组成的强基线网络,并在三个具有挑战性的真实世界视频数据集(Human 3.6M、Caltech Pedestrian和UCF-101)上实现了下一步预测的最先进性能。此外,它使用的参数少于最近提出的几个模型,且不依赖于深度卷积网络、多尺度架构、背景与前景建模分离、运动流学习或对抗训练。这些结果突显了完全感知过去上下文对视频预测至关重要。

关键词

引用

@article{arxiv.1710.08518,
  title  = {ContextVP: Fully Context-Aware Video Prediction},
  author = {Wonmin Byeon and Qin Wang and Rupesh Kumar Srivastava and Petros Koumoutsakos},
  journal= {arXiv preprint arXiv:1710.08518},
  year   = {2018}
}

备注

19 pages. ECCV 2018 oral presentation. Project webpage is at https://wonmin-byeon.github.io/publication/2018-eccv