中文

基于 CNN 的多阶段门控平均融合(MGAF)用于深度与惯性传感器人体动作识别

计算机视觉与模式识别 2020-11-02 v1 机器学习 多媒体 图像与视频处理

摘要

卷积神经网络(CNN)为从其架构的所有层中提取和融合特征提供了便利。然而,针对使用深度与惯性传感器的人体动作识别(HAR),从不同 CNN 层中提取并融合中间特征仍未被探索。为最大程度利用访问 CNN 所有层的优势,本文提出新颖的多阶段门控平均融合(MGAF)网络,该网络使用我们新颖且计算高效的门控平均融合(GAF)网络(MGAF 的决定性组成单元)从 CNN 的所有层提取并融合特征。在提出的 MGAF 输入处,我们将深度与惯性传感器数据分别转换为称为顺序前视图图像(SFI)和信号图像(SI)的深度图像。这些 SFI 由深度数据生成的前视图信息构成。CNN 用于从两种输入模态中提取特征图。GAF 网络在保留融合特征维度的同时有效融合所提取的特征。提出的 MGAF 网络具有结构可扩展性,可扩展至两种以上模态。在三个公开多模态 HAR 数据集上的实验表明,所提 MGAF 在识别准确率上优于先前最优的深度-惯性 HAR 融合方法,同时计算效率更高。相比先前最优方法,我们将准确率平均提升 1.5%,同时将计算成本降低约 50%。

关键词

引用

@article{arxiv.2010.16073,
  title  = {CNN based Multistage Gated Average Fusion (MGAF) for Human Action Recognition Using Depth and Inertial Sensors},
  author = {Zeeshan Ahmad and Naimul khan},
  journal= {arXiv preprint arXiv:2010.16073},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:1910.11482