面向有限标注数据下 RGB 视频流鲁棒人体活动识别的研究
计算机视觉与模式识别
2018-12-18 v1 人工智能
机器学习
摘要
基于视频流的人体活动识别近年来受到广泛关注。由于缺乏深度信息,基于 RGB 视频的活动识别相较于基于 RGB-D 视频的方案表现较差。另一方面,获取深度信息、惯性数据等成本高昂且需要专用设备,而 RGB 视频流在普通相机中即可获得。因此,我们的目标是探究仅用 RGB 模态是否能达到甚至更高的准确率。为此,我们提出一种新颖的框架,将自 RGB 视频提取的骨架数据与深度双向长短期记忆(BLSTM)模型结合用于活动识别。训练此类深度网络的一大挑战是训练数据有限,而仅探索 RGB 流显著加剧了这一困难。因此我们提出一组算法技术以有效训练该模型,例如数据增强、动态帧丢弃与梯度注入。实验表明,我们的纯 RGB 方案以明显优势超越了所有利用 RGB-D 视频流的当前最优(state-of-the-art)方法。这使得我们的方案可广泛部署于普通相机。
引用
@article{arxiv.1812.06544,
title = {Towards Robust Human Activity Recognition from RGB Video Stream with Limited Labeled Data},
author = {Krishanu Sarker and Mohamed Masoud and Saeid Belkasim and Shihao Ji},
journal= {arXiv preprint arXiv:1812.06544},
year = {2018}
}
备注
To appear in ICMLA 2018