中文

利用ConvLSTM:基于原始深度视频的循环神经网络人体动作识别

计算机视觉与模式识别 2020-06-16 v1

摘要

与许多其他领域一样,深度学习已成为大多数计算机视觉应用的主要方法,例如场景理解、目标识别、计算机-人交互或人体动作识别(HAR)。HAR领域的研究工作主要集中在如何高效地提取和处理视频序列的空间和时间依赖性。在本文中,我们提出并比较了两种基于卷积长短期记忆单元(ConvLSTM)的神经网络,它们在架构和长期学习策略上有所不同。前者使用一种视频长度自适应的输入数据生成器(无状态),而后者则探索了通用循环神经网络的有状态能力,但应用于HAR这一特定场景。这种有状态特性允许模型在不消耗过多计算机内存的情况下,从先前帧中积累判别性模式。在大规模NTU RGB+D数据集上的实验结果表明,与最先进的方法相比,所提出的模型以更低的计算成本实现了具有竞争力的识别准确率,并证明在视频的特定情况下,循环神经网络中很少使用的有状态模式显著提高了标准模式下获得的准确率。无状态模型获得的识别准确率为75.26%(CS)和75.45%(CV),每个视频的平均耗时0.21秒;有状态版本则为80.43%(CS)和79.91%(CV),耗时0.89秒。

关键词

引用

@article{arxiv.2006.07744,
  title  = {Exploiting the ConvLSTM: Human Action Recognition using Raw Depth Video-Based Recurrent Neural Networks},
  author = {Adrian Sanchez-Caballero and David Fuentes-Jimenez and Cristina Losada-Gutiérrez},
  journal= {arXiv preprint arXiv:2006.07744},
  year   = {2020}
}