中文

基于RGB-D的轻量级三维卷积网络动作识别

计算机视觉与模式识别 2018-11-27 v1

摘要

与RGB视频不同,RGB-D视频中的深度数据为三刺激视觉数据提供了关键的互补信息,有可能提高动作识别的准确率。然而,大多数现有的仅使用RGB视频的动作识别模型限制了性能上限。此外,最先进的动作识别模型,即三维卷积神经网络(3D-CNNs),包含海量参数,存在计算效率低下的问题。本文中,我们提出了一系列基于RGB-D数据的轻量级三维动作识别架构。与传统的3D-CNN模型相比,所提出的轻量级3D-CNNs参数大幅减少,计算成本更低,同时取得了良好的识别性能。在两个公开基准数据集上的实验结果表明,我们的模型可以接近或超越最先进的方法。具体而言,在RGB+D-NTU(NTU)数据集上,我们在跨主体和跨视角度量下分别达到93.2%和97.6%;在Northwestern-UCLA Multiview Action 3D(N-UCLA)数据集上,我们达到95.5%的跨视角准确率。

关键词

引用

@article{arxiv.1811.09908,
  title  = {RGB-D Based Action Recognition with Light-weight 3D Convolutional Networks},
  author = {Haokui Zhang and Ying Li and Peng Wang and Yu Liu and Chunhua Shen},
  journal= {arXiv preprint arXiv:1811.09908},
  year   = {2018}
}

备注

14 pages