中文

用于下一帧视频预测的 Inception 启发式 LSTM

计算机视觉与模式识别 2020-04-27 v2 机器学习 机器学习

摘要

视频帧预测问题因其与自动驾驶车辆或机器人等许多计算机视觉应用的相关性而受到广泛关注。视频帧预测的监督方法依赖于标注数据,而这些数据未必总可获得。本文提出一种名为基于 Inception 的 LSTM 的新型无监督深度学习方法用于视频帧预测。Inception 网络的一般思想是实现更宽的网络而非更深的网络。该网络设计已被证明可提升图像分类性能。所提方法在 Inception-v1 和 Inception-v2 结构上进行评估。在 KITTI 和 KTH 数据集上,将所提 Inception LSTM 方法与使用 PredNet 预测编码框架的卷积 LSTM 进行比较。我们观察到基于 Inception 的 LSTM 优于卷积 LSTM。此外,Inception LSTM 相比 Inception v2 LSTM 具有更好的预测性能。然而,Inception v2 LSTM 相比 Inception LSTM 具有更低的计算成本。

关键词

引用

@article{arxiv.1909.05622,
  title  = {Inception-inspired LSTM for Next-frame Video Prediction},
  author = {Matin Hosseini and Anthony S. Maida and Majid Hosseini and Gottumukkala Raju},
  journal= {arXiv preprint arXiv:1909.05622},
  year   = {2020}
}