中文

一种用于自动多模态人体活动识别系统的视觉与惯性传感器数据双流决策级融合新方法

计算机视觉与模式识别 2023-06-29 v1

摘要

本文提出了一种新颖的多模态人体活动识别系统。它使用视觉与惯性传感器的双流决策级融合。在第一流中,原始 RGB 帧被传入基于 part affinity field 的姿态估计网络以检测用户的关节点。这些关节点随后被预处理并以滑动窗口方式输入专门设计的卷积神经网络进行空间特征提取,接着使用正则化 LSTM 计算时间特征。LSTM 网络的输出随后输入全连接层进行分类。在第二流中,从惯性传感器获得的数据被预处理并输入正则化 LSTM 进行特征提取,接着通过全连接层进行分类。在此阶段,两流的 SoftMax 分数随后使用决策级融合进行融合,给出最终预测。我们进行了大量实验以评估性能。使用了四个多模态标准基准数据集(UP-Fall detection、UTD-MHAD、Berkeley-MHAD 和 C-MHAD)进行实验。所提系统在 UP-Fall Detection、UTDMHAD、Berkeley-MHAD 和 C-MHAD 数据集上分别获得的准确率为 96.9%、97.6%、98.7% 和 95.9%。这些结果远优于当前最先进的方法。

关键词

引用

@article{arxiv.2306.15765,
  title  = {A Novel Two Stream Decision Level Fusion of Vision and Inertial Sensors Data for Automatic Multimodal Human Activity Recognition System},
  author = {Santosh Kumar Yadav and Muhtashim Rafiqi and Egna Praneeth Gummana and Kamlesh Tiwari and Hari Mohan Pandey and Shaik Ali Akbara},
  journal= {arXiv preprint arXiv:2306.15765},
  year   = {2023}
}