基于三流CNN的动作识别序列深度轨迹描述子
计算机视觉与模式识别
2017-02-13 v2
摘要
学习运动信息的时空表示对人类动作识别至关重要。然而,现有的多数特征或描述子无法有效捕捉运动信息,尤其是长期运动。为解决此问题,本文提出了一种称为序列深度轨迹描述子(sDTD)的长期运动描述子。具体而言,我们将密集轨迹投影到二维平面,随后采用CNN-RNN网络学习长期运动的有效表示。不同于流行的双流ConvNets,sDTD流被引入到一个三流框架中,以便从视频序列中识别动作。因此,该三流框架能够同时捕捉视频中的静态空间特征、短期运动和长期运动。我们在三个具有挑战性的数据集:KTH、HMDB51和UCF101上进行了大量实验。实验结果表明,我们的方法在KTH和UCF101数据集上取得了SOTA性能,在HMDB51数据集上与SOTA方法相当。
引用
@article{arxiv.1609.03056,
title = {Sequential Deep Trajectory Descriptor for Action Recognition with Three-stream CNN},
author = {Yemin Shi and Yonghong Tian and Yaowei Wang and Tiejun Huang},
journal= {arXiv preprint arXiv:1609.03056},
year = {2017}
}
备注
10 pages, 29 figures, T-MM