深度卷积网络中卷积层的池化在动作识别中的应用
计算机视觉与模式识别
2015-11-09 v1
摘要
深度 ConvNets 在图像分类任务中展现了良好的性能。然而,深度视频表示在动作识别中仍是一个待解决的问题。该问题源于两个方面:一方面,当前的图像 ConvNets 相比,现有的视频 ConvNets 相对较浅,这限制了其捕获复杂视频动作信息的能力;另一方面,视频的时间信息未被合理利用以池化和编码视频序列。针对这些问题,本文利用两种 state-of-the-art 的 ConvNets,即非常深的空间网络 (VGGNet) 和 Two-Stream ConvNets 中的时间网络,进行动作表示。卷积层和提出的新层(称为 frame-diff 层)被提取,并采用两种时间池化策略:Trajectory pooling 和 line pooling 进行池化。随后,池化后的局部描述符用 VLAD 编码以形成视频表示。为了验证所提出框架的有效性,我们在 UCF101 和 HMDB51 数据集上进行了实验。该方法在 UCF101 上达到了 93.78% 的准确率,为 state-of-the-art;在 HMDB51 上达到了 65.62% 的准确率,与 state-of-the-art 相当。
引用
@article{arxiv.1511.02126,
title = {Pooling the Convolutional Layers in Deep ConvNets for Action Recognition},
author = {Shichao Zhao and Yanbin Liu and Yahong Han and Richang Hong},
journal= {arXiv preprint arXiv:1511.02126},
year = {2015}
}