中文

用于动作识别的深度局部视频特征

计算机视觉与模式识别 2017-01-31 v2

摘要

我们研究使用CNN特征表示整个视频用于人体动作识别的问题。目前,受限于GPU内存,我们还无法将整个视频输入CNN/RNN进行端到端学习。一种常见做法是以采样帧作为输入并以视频标签作为监督。这种流行方法的一个主要问题是局部样本可能不包含全局标签所指示的信息。为处理该问题,我们提议将基于局部输入训练的深层网络视为局部特征提取器。提取局部特征后,我们将它们聚合为全局特征,并在相同训练数据上训练另一个映射函数将全局特征映射到全局标签。我们研究关于这类新型局部特征的一组问题,例如如何将它们聚合为全局特征。在HMDB51和UCF101数据集上的实验结果表明,对于这些新局部特征,对稀疏采样特征进行简单的最大池化可带来显著的性能提升。

关键词

引用

@article{arxiv.1701.07368,
  title  = {Deep Local Video Feature for Action Recognition},
  author = {Zhenzhong Lan and Yi Zhu and Alexander G. Hauptmann},
  journal= {arXiv preprint arXiv:1701.07368},
  year   = {2017}
}