中文

预测未来帧中的手部和物体

计算机视觉与模式识别 2018-08-24 v3

摘要

本文提出了一种预测人手和物体未来存在状态及位置的方法。给定一个图像帧,目标是预测未来帧(例如5秒后)中将出现哪些物体以及它们将位于何处,即使它们在当前帧中不可见。其核心思想在于:(1) 卷积物体识别模型的中间表示在其帧内抽象了场景信息;(2) 我们可以基于当前帧的表示来预测(即回归)对应于未来帧的此类表示。我们通过扩展当前最优的卷积物体检测网络,为视频设计了一种新的双流卷积神经网络(CNN)架构,并提出了一种用于预测未来场景表示的新的全卷积回归网络。我们的实验证实,将回归得到的未来表示与我们的检测网络相结合,能够可靠地估计视频中未来的手部和物体。在一个公开数据集上,我们获得了比当前最优的未来物体存在预测方法高得多的准确率。

关键词

引用

@article{arxiv.1705.07328,
  title  = {Forecasting Hands and Objects in Future Frames},
  author = {Chenyou Fan and Jangwon Lee and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:1705.07328},
  year   = {2018}
}