基于卷积神经网络及深度与惯性传感器数据多模态融合的改进人体动作识别
计算机视觉与模式识别
2020-08-25 v1 人工智能
机器学习
摘要
本文试图通过融合深度与惯性传感器数据来提高人体动作识别(HAR)的准确率。首先,我们将深度数据转换为顺序前视图图像(SFI)并在这些图像上微调预训练的AlexNet。然后,将惯性数据转换为信号图像(SI)并在这些图像上训练另一个卷积神经网络(CNN)。最后,从两个CNN中提取学习到的特征,融合在一起构成共享特征层,并将这些特征输入分类器。我们使用两种分类器进行实验,即支持向量机(SVM)和softmax分类器,并比较其性能。还计算了每种模态(仅深度数据和仅传感器数据)的识别准确率,并与基于融合的准确率进行比较,以突显模态融合比单一模态产生更好结果这一事实。在UTD-MHAD和Kinect 2D数据集上的实验结果表明,与近期其他提出的视觉-惯性动作识别方法相比,所提方法达到了最先进的性能。
引用
@article{arxiv.2008.09747,
title = {Towards Improved Human Action Recognition Using Convolutional Neural Networks and Multimodal Fusion of Depth and Inertial Sensor Data},
author = {Zeeshan Ahmad and Naimul Khan},
journal= {arXiv preprint arXiv:2008.09747},
year = {2020}
}