中文

AdaScan:深度卷积神经网络中用于视频人体动作识别的自适应扫描池化

计算机视觉与模式识别 2017-06-27 v4

摘要

我们提出了一种用于视频中人体动作识别任务的时间维度帧池化新方法。该方法的动机源于如下观察:仅少数帧共同包含足够信息以将视频中存在的动作类别与其余帧区分开。所提方法学习池化此类具有判别性且信息丰富的帧,同时在视频的单次时间扫描中丢弃大多数非信息帧。我们的算法通过持续预测每个视频帧的判别重要性,随后在深度学习框架中对它们进行池化来实现这一点。我们在标准基准上展示了所提池化方法的有效性,无论是基于 RGB 还是光流的卷积网络,它都持续优于基线池化方法。此外,结合互补的视频表示,我们展示的结果在两个具有挑战性且公开可用的基准数据集上与最先进 (state-of-the-art) 结果具有竞争力。

关键词

引用

@article{arxiv.1611.08240,
  title  = {AdaScan: Adaptive Scan Pooling in Deep Convolutional Neural Networks for Human Action Recognition in Videos},
  author = {Amlan Kar and Nishant Rai and Karan Sikka and Gaurav Sharma},
  journal= {arXiv preprint arXiv:1611.08240},
  year   = {2017}
}

备注

CVPR 2017 Camera Ready Version