中文

用于索引自我中心视频的紧凑 3D CNN

计算机视觉与模式识别 2017-01-06 v2

摘要

尽管自我中心视频日益流行,浏览它却十分困难。本文我们提出一种紧凑的 3D 卷积神经网络(CNN)架构,用于自我中心视频中的长期活动识别。识别长期活动使我们能够对长而无结构的自我中心视频进行时间分割(索引)。该任务的现有方法基于从可见物体、手部位置以及光流中导出的手工调参特征。给定稀疏光流体作为输入,我们的 CNN 对佩戴者(相机)的活动进行分类。我们获得了 89% 的分类准确率,优于当前最先进水平 19%。在扩展的自我中心视频数据集上进行了额外评估,分类类别数量为当前最先进水平的两倍。此外,我们的 CNN 能够以 99.2% 的准确率识别视频是否为自我中心视频,较当前最先进水平提升 24%。为了更好地理解网络实际学习到了什么,我们提出了一种将 CNN 核可视化为流场的新方法。

关键词

引用

@article{arxiv.1504.07469,
  title  = {Compact CNN for Indexing Egocentric Videos},
  author = {Yair Poleg and Ariel Ephrat and Shmuel Peleg and Chetan Arora},
  journal= {arXiv preprint arXiv:1504.07469},
  year   = {2017}
}