中文

面向有限标注数据下 RGB 视频流鲁棒人体活动识别的研究

计算机视觉与模式识别 2018-12-18 v1 人工智能 机器学习

摘要

基于视频流的人体活动识别近年来受到广泛关注。由于缺乏深度信息,基于 RGB 视频的活动识别相较于基于 RGB-D 视频的方案表现较差。另一方面,获取深度信息、惯性数据等成本高昂且需要专用设备,而 RGB 视频流在普通相机中即可获得。因此,我们的目标是探究仅用 RGB 模态是否能达到甚至更高的准确率。为此,我们提出一种新颖的框架,将自 RGB 视频提取的骨架数据与深度双向长短期记忆(BLSTM)模型结合用于活动识别。训练此类深度网络的一大挑战是训练数据有限,而仅探索 RGB 流显著加剧了这一困难。因此我们提出一组算法技术以有效训练该模型,例如数据增强、动态帧丢弃与梯度注入。实验表明,我们的纯 RGB 方案以明显优势超越了所有利用 RGB-D 视频流的当前最优(state-of-the-art)方法。这使得我们的方案可广泛部署于普通相机。

关键词

引用

@article{arxiv.1812.06544,
  title  = {Towards Robust Human Activity Recognition from RGB Video Stream with Limited Labeled Data},
  author = {Krishanu Sarker and Mohamed Masoud and Saeid Belkasim and Shihao Ji},
  journal= {arXiv preprint arXiv:1812.06544},
  year   = {2018}
}

备注

To appear in ICMLA 2018