RGB 视频中基于骨架关注的人体活动识别
计算机视觉与模式识别
2020-04-30 v1 机器学习
图像与视频处理
摘要
学习视觉特征(如骨架帧或 RGB 视频)最优表示的数据驱动方法,是当前活动识别的主流范式。尽管现有单模态方法在日益增大的数据集上取得了巨大改进,但在特征层面融合多种数据模态的尝试很少。本文提出一种利用骨架与 RGB 两种模态推断人体活动的多模态特征融合模型。目标是通过有效利用不同数据模态间的相互互补信息来提升活动识别准确率。对于骨架模态,我们提出使用图卷积子网络学习骨架表示;对于 RGB 模态,我们利用 RGB 视频的时空感兴趣区域,并取骨架模态的注意力特征来引导学习过程。该模型可通过反向传播算法以端到端方式单独或统一训练。在 NTU-RGB+D 和 Northwestern-UCLA 多视角数据集上的实验结果达到了最先进性能,表明所提出的面向 RGB 模态的骨架驱动注意力机制增强了不同数据模态间的相互通信,并为推断人体活动带来了更具判别性的特征。
引用
@article{arxiv.2004.13979,
title = {Skeleton Focused Human Activity Recognition in RGB Video},
author = {Bruce X. B. Yu and Yan Liu and Keith C. C. Chan},
journal= {arXiv preprint arXiv:2004.13979},
year = {2020}
}
备注
8 pages