中文

通过优化图卷积网络和Transformer架构参数集成特征以识别人类活动

计算机视觉与模式识别 2024-08-30 v1 人工智能 机器人学

摘要

人类活动识别是运用计算机视觉、机器视觉和深度学习技术对人类动作进行分类的主要研究领域。深度学习领域取得了显著进展,各种有效的架构能够很好地捕获人类动力学。本研究强调特征融合对活动识别准确率的影响。该技术解决了传统模型在理解空间和时间特征方面能力有限,从而难以识别活动的问题。该技术采用来自四个公开数据集 (HuGaDB、PKU-MMD、LARa 和 TUG) 的感应数据。评估了两种深度学习模型 (具体为Transformer模型和参数优化图卷积网络 (PO-GCN)) 的准确率和 F1 分数。特征融合技术将两个模型的最终层特征整合输入分类器。实证证据表明,PO-GCN 在活动识别方面优于标准模型。HuGaDB 实现了 2.3% 的准确率提升和 2.2% 的 F1 分数提升。TUG 显示出 5% 的准确率提高和 0.5% 的 F1 分数增加。另一方面,LARa 和 PKU-MMD 分别达到了 64% 和 69% 的较低准确率。这表明特征融合的整合增强了Transformer模型和PO-GCN的性能。

关键词

引用

@article{arxiv.2408.16442,
  title  = {Integrating Features for Recognizing Human Activities through Optimized Parameters in Graph Convolutional Networks and Transformer Architectures},
  author = {Mohammad Belal and Taimur Hassan and Abdelfatah Hassan and Nael Alsheikh and Noureldin Elhendawi and Irfan Hussain},
  journal= {arXiv preprint arXiv:2408.16442},
  year   = {2024}
}

备注

6 pages, 1 figure, conference