基于轨迹池化深度卷积描述子的动作识别
计算机视觉与模式识别
2016-11-17 v1
摘要
视觉特征对于视频中人类动作的理解至关重要。本文提出一种新的视频表示,称为轨迹池化深度卷积描述子(trajectory-pooled deep-convolutional descriptor, TDD),它兼具手工特征和深度学习特征的优点。具体而言,我们利用深度架构学习具有判别力的卷积特征图,并进行轨迹约束池化,将这些卷积特征聚合成有效的描述子。为增强 TDD 的鲁棒性,我们设计了两种归一化方法来变换卷积特征图,即时空归一化与通道归一化。我们特征的优势在于:(i) TDD 自动学习得到,与手工特征相比具有更高的判别能力;(ii) TDD 考虑了时间维度的内在特性,并引入轨迹约束采样与池化策略来聚合深度学习特征。我们在两个具有挑战性的数据集 HMDB51 和 UCF101 上进行了实验。实验结果表明,TDD 优于先前的手工特征和深度学习特征。我们的方法在这些数据集上还取得了优于当前最优(state of the art)的性能(HMDB51 65.9%, UCF101 91.5%)。
引用
@article{arxiv.1505.04868,
title = {Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors},
author = {Limin Wang and Yu Qiao and Xiaoou Tang},
journal= {arXiv preprint arXiv:1505.04868},
year = {2016}
}
备注
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2015