中文

用于动作识别的多模态三流网络

计算机视觉与模式识别 2019-09-10 v1 人工智能 人机交互 机器学习

摘要

由于数据的高变异性与复杂性,视频中的人体动作识别是一个活跃且具有挑战性的研究课题。本文提出一种利用互补线索的基于视频的动作识别新框架来处理这一复杂问题。受成功的双流动作分类网络启发,我们研究并融合了额外的姿态特征,以更抽象和语义化的方式增强对人体动作的理解。在实践方面,不仅真实姿态,而且我们提出的预处理模块所融入的含噪估计姿态也被纳入框架。整个框架及每种线索在 JHMDB、sub-JHMDB 和 Penn Action 等多个基准数据集上进行了评估。我们的结果在这些数据集上优于当前最优性能,并展示了互补线索的优势。

关键词

引用

@article{arxiv.1909.03466,
  title  = {Multi-Modal Three-Stream Network for Action Recognition},
  author = {Muhammad Usman Khalid and Jie Yu},
  journal= {arXiv preprint arXiv:1909.03466},
  year   = {2019}
}

备注

Presented in IEEE ICPR 2018