使用子动作描述符与多 CNN 的视频监控实时动作检测
计算机视觉与模式识别
2017-10-11 v1
摘要
当我们说一个人在发短信时,你能说出这个人是在走路还是坐着吗?显然不能。为了解决这种不完整表示的问题,本文提出了一种用于详细动作检测的子动作描述符。该子动作描述符由三个层次组成:姿态层、移动层和手势层。这三个层次为单个动作提供了三个子动作类别,以解决表示问题。所提出的动作检测模型使用基于外观的时序特征和多 CNN,同时定位和识别视频监控中多个个体的动作。在作者随本文介绍并公开给社区的新的大规模 ICVL 视频监控数据集上,该方法在基于帧的测量中达到了 76.6% 的平均精度均值 (mAP),在基于视频的测量中达到了 83.5%。在基准 KTH 数据集上的大量实验表明,所提出的方法取得了更好的性能,从而在动作识别性能上超越了现有最优水平。该动作检测模型在 ICVL 数据集上能以约 25 fps 的速度运行,在 KTH 数据集上超过 80 fps,适用于实时监控应用。
引用
@article{arxiv.1710.03383,
title = {Real-Time Action Detection in Video Surveillance using Sub-Action Descriptor with Multi-CNN},
author = {Cheng-Bin Jin and Shengzhe Li and Hakil Kim},
journal= {arXiv preprint arXiv:1710.03383},
year = {2017}
}
备注
29 pages, 16 figures