基于时空CNN的信息丰富采样技术用于视频中人体动作分类
计算机视觉与模式识别
2020-02-10 v2 机器学习
摘要
我们提出了一种用于视频中人体动作识别的新方案,采用基于三维卷积神经网络(3D CNN)的分类器。在传统基于深度学习的人体活动识别方法中,通常取视频的少数随机帧或每第帧用于训练3D CNN,其中为较小的正整数,如4、5或6。此类采样减少了输入数据量,从而加速网络训练,并在一定程度上避免过拟合,进而提升3D CNN模型性能。在所提出的视频采样技术中,将视频连续的帧通过这帧的高斯加权求和聚合成单帧。所得帧(聚合帧)比传统方法更好地保留了信息,且实验表明其性能更优。本文提出一种3D CNN架构以提取时空特征,并接长短期记忆(LSTM)网络来识别人体动作。所提3D CNN架构能够处理摄像机远离执行者的视频。我们在KTH与WEIZMANN人体动作数据集上进行了实验,结果表明其与最先进的技术取得了可比的结果。
引用
@article{arxiv.2002.02100,
title = {An Information-rich Sampling Technique over Spatio-Temporal CNN for Classification of Human Actions in Videos},
author = {S. H. Shabbeer Basha and Viswanath Pulabaigari and Snehasis Mukherjee},
journal= {arXiv preprint arXiv:2002.02100},
year = {2020}
}