中文

基于深度多级多模态(M2)融合的深度与惯性传感器人体动作识别

机器学习 2019-10-28 v1 计算机视觉与模式识别 机器学习

摘要

近年来已提出多种利用深度与惯性传感器数据的人体动作识别(HAR)多模态融合框架。在多数现有工作中,融合仅在单一层级(特征级或决策级)进行,错失了融合丰富中级特征以提升分类性能的机会。为解决此不足,本文提出三种新颖的深度多级多模态融合框架,以在不同阶段利用不同融合策略并发挥多级融合的优势。在输入处,我们将深度数据转换为称为序列前视图图像(SFIs)的深度图像,并将惯性传感器数据转换为信号图像。通过对 Prewitt 滤波器进行卷积,每种输入模态(深度与惯性)进一步变为多模态。创建“模态中的模态”可通过卷积神经网络(CNNs)实现进一步的互补与判别特征提取。CNNs 在每种模态的输入图像上训练以学习低级、高级及复杂特征。所学习特征在提出框架的不同阶段被提取并融合,以结合判别性与互补性信息。这些高信息量特征作为多类支持向量机(SVM)的输入。我们在三个公开多模态 HAR 数据集(即 UTD 多模态人体动作数据集(MHAD)、Berkeley MHAD 和 UTD-MHAD Kinect V2)上评估所提框架。实验结果表明所提融合框架优于现有方法。

关键词

引用

@article{arxiv.1910.11482,
  title  = {Human Action Recognition Using Deep Multilevel Multimodal (M2) Fusion of Depth and Inertial Sensors},
  author = {Zeeshan Ahmad and Naimul Khan},
  journal= {arXiv preprint arXiv:1910.11482},
  year   = {2019}
}

备注

10 pages, 13 figures