面向机器人感知的短视频目标识别
计算机视觉与模式识别
2015-09-08 v1
摘要
深度神经网络已成为目标识别的主要学习技术。与静态图像不同,视频具有时间连贯性,这使得深度网络的应用并非易事。在此,我们研究运动如何辅助短视频中的目标识别。我们的方法基于长短期记忆(LSTM)深度网络。与以往的 LSTM 应用不同,我们将每个门控实现为一个卷积。我们证明,基于卷积的 LSTM 模型能够学习运动依赖性,并且当序列中可用帧数更多时,能够提高识别准确率。我们在 Washington RGBD Object 数据集和 Washington RGBD Scenes 数据集上评估了我们的方法。我们的方法优于应用于静态图像的深度网络,并在该领域设立了新的最优性能。
引用
@article{arxiv.1509.01602,
title = {Object Recognition from Short Videos for Robotic Perception},
author = {Ivan Bogun and Anelia Angelova and Navdeep Jaitly},
journal= {arXiv preprint arXiv:1509.01602},
year = {2015}
}
备注
7 pages, 6 figures, 3 tables