中文

无监督的分层长期视频预测

计算机视觉与模式识别 2018-06-14 v1

摘要

近期大量研究致力于视频预测与生成,但先前大多数工作仅在短期范围内的视频生成上取得了有限成功。Villegas 等人(2017)的分层视频预测方法是对长期视频预测达到最先进水平的例子,但他们的方法存在局限,因为其在训练时需要高层结构的真值标注(例如人体关节地标)。我们的网络对输入帧进行编码,将高层编码预测到未来,然后一个能访问第一帧的解码器由预测编码生成预测图像。该解码器还作为副产物生成勾勒出预测前景物体(例如人)的掩码。与 Villegas 等人(2017)不同,我们开发了一种新颖的训练方法,可在无高层监督下联合训练编码器、预测器和解码器;我们进一步通过在特征空间中使用对抗损失来训练预测器以改进此方法。我们的方法能预测约 20 秒的未来,并且在 Human 3.6M 数据集上相比 Denton 和 Fergus(2018)以及 Finn 等人(2016)提供了更好的结果。

关键词

引用

@article{arxiv.1806.04768,
  title  = {Hierarchical Long-term Video Prediction without Supervision},
  author = {Nevan Wichers and Ruben Villegas and Dumitru Erhan and Honglak Lee},
  journal= {arXiv preprint arXiv:1806.04768},
  year   = {2018}
}

备注

International Conference on Machine Learning (ICML) 2018