中文

深入探索第一人称活动识别

计算机视觉与模式识别 2016-05-13 v1

摘要

我们将近期关于以自我为中心的动作识别特征设计的工作整合到一个框架下,通过探索深度卷积神经网络(CNN)的使用。近期研究表明,手部外观、物体属性、局部手部运动以及相机自我运动等特征对于表征第一人称动作至关重要。为了将这些想法整合到一个框架中,我们提出了一种双流网络架构,其中一个流分析外观信息,另一个流分析运动信息。我们的外观流通过显式训练网络分割手部和定位物体,编码了以自我为中心范式的先验知识。通过可视化我们网络的某些神经元激活,我们展示了所提出的架构自然地学习到了捕捉物体属性和手-物配置的特征。我们在基准以自我为中心的动作数据集上进行的大量实验表明,我们的深度架构使得识别率显著超越了当前最先进的技术——在所有数据集上平均准确率提高了6.6%6.6\%。此外,通过联合学习识别物体、动作和活动,单个识别任务的性能也分别提高了30%30\%(动作)和14%14\%(物体)。我们还包含了广泛的消融分析结果,以突出网络设计决策的重要性。

关键词

引用

@article{arxiv.1605.03688,
  title  = {Going Deeper into First-Person Activity Recognition},
  author = {Minghuang Ma and Haoqi Fan and Kris M. Kitani},
  journal= {arXiv preprint arXiv:1605.03688},
  year   = {2016}
}