中文

重温用于持久长期视频预测的分层方法

计算机视觉与模式识别 2021-04-15 v1

摘要

学习预测视频帧的长期未来因遥远未来的固有模糊性以及预测误差随时间剧烈放大而 notoriously 具有挑战性。尽管文献中已有近期进展,现有方法仅限于中等短期预测(少于几秒),而将其外推至更长远未来会迅速导致结构与内容崩坏。本工作中,我们重温视频预测中的分层模型。我们的方法通过先估计一系列语义结构序列,随后通过视频到视频转换将结构翻译为像素来预测未来帧。尽管简单,我们表明在离散语义结构空间中用随机循环估计器建模结构及其动态可带来令人惊讶成功的长期预测。我们在涉及驾车与人类舞蹈的三个具挑战性数据集上评估了方法,并证明其能在极长时间范围(即数千帧)生成复杂场景结构与运动,确立了视频预测新标准,预测时长比现有方法长数个数量级。完整视频与代码见 https://1konny.github.io/HVP/。

关键词

引用

@article{arxiv.2104.06697,
  title  = {Revisiting Hierarchical Approach for Persistent Long-Term Video Prediction},
  author = {Wonkwang Lee and Whie Jung and Han Zhang and Ting Chen and Jing Yu Koh and Thomas Huang and Hyungsuk Yoon and Honglak Lee and Seunghoon Hong},
  journal= {arXiv preprint arXiv:2104.06697},
  year   = {2021}
}

备注

Accepted as a conference paper at ICLR 2021