中文

基于体素化三维运动表征的动作识别

计算机视觉与模式识别 2019-11-21 v1 图像与视频处理

摘要

传统的动作识别模型围绕二维透视图像范式构建。尽管复杂的时间序列模型推动了该领域发展,但将域限制在二维仍使大量信息未被利用。本工作中,我们引入一种将运动表示为体素化三维向量场的新表征,并展示如何用它提升动作识别网络的性能。该体素表征天然适配 3D CNN,并允许在这些网络训练期间使用平面外数据增强技术。从 RGB-D 视频构建此表征及推理均可实时运行。我们在开源 NTU RGB+D 数据集上用此表征结合我们的网络设计展示了优越结果,在两个定义的评估指标上均优于 SOTA。此外,我们通过实验展示平面外增强技术如何创造视角不变性,并使采用此表征训练的模型泛化到未见过的相机角度。代码见:https://github.com/mpeven/ntu_rgb。

关键词

引用

@article{arxiv.1911.08511,
  title  = {Action Recognition Using Volumetric Motion Representations},
  author = {Michael Peven and Gregory D. Hager and Austin Reiter},
  journal= {arXiv preprint arXiv:1911.08511},
  year   = {2019}
}