中文

视频阶梯网络

机器学习 2017-01-02 v3 计算机视觉与模式识别 机器学习

摘要

我们提出了视频阶梯网络(VLN),用于高效地生成未来视频帧。VLN 是一种神经编码器-解码器模型,在所有层上通过循环和前馈横向连接进行增强。在每一层,这些连接形成一个横向循环残差块,其中前馈连接表示跳跃连接,循环连接表示残差。得益于循环连接,解码器可以利用从编码器所有层生成的时间摘要。这样,顶层就免除了建模较低层空间和时间细节的压力。此外,我们将 VLN 的基本版本扩展为在编码器和解码器中并入 ResNet 风格的残差块,这有助于改善预测结果。VLN 在 Moving MNIST 数据集上以自监督方式进行训练,在具有非常简单的结构并提供快速推理的同时,取得了具有竞争力的结果。

关键词

引用

@article{arxiv.1612.01756,
  title  = {Video Ladder Networks},
  author = {Francesco Cricri and Xingyang Ni and Mikko Honkala and Emre Aksu and Moncef Gabbouj},
  journal= {arXiv preprint arXiv:1612.01756},
  year   = {2017}
}

备注

This version extends the paper accepted at the NIPS 2016 workshop on ML for Spatiotemporal Forecasting, with more details and more experimental results