中文

何与何地:从语义与空间视角建模骨架用于动作识别

计算机视觉与模式识别 2021-03-23 v2

摘要

骨架数据仅由人体关节的 2D/3D 坐标组成,已广泛用于人体动作识别。现有方法将语义作为先验知识来分组人体关节,并依据其空间位置绘制关联,我们称之为骨架建模的语义视角。本文中,与以往方法相反,我们提出从一种新颖的空间视角对骨架建模,该视角下模型以空间位置作为先验知识来分组人体关节,并以分层方式挖掘局部区域的判别性模式。两种视角彼此正交且互补;通过在统一框架中融合二者,我们的方法实现了对骨架数据更全面的理解。此外,我们为两种视角定制了两个网络。从语义视角,我们提出一个擅长建模关节关联的 Transformer 类网络,并给出三种将其适配于骨架数据的有效技术。从空间视角,我们将骨架数据转换为稀疏格式以高效提取特征,并提出两类用于稀疏骨架建模的稀疏卷积网络。我们在三个具挑战性的基于骨架的人体动作/手势识别数据集(即 NTU-60、NTU-120 和 SHREC)上进行了充分实验,我们的方法取得了最先进的(state-of-the-art, SOTA)性能。

关键词

引用

@article{arxiv.2004.03259,
  title  = {What and Where: Modeling Skeletons from Semantic and Spatial Perspectives for Action Recognition},
  author = {Lei Shi and Yifan Zhang and Jian Cheng and Hanqing Lu},
  journal= {arXiv preprint arXiv:2004.03259},
  year   = {2021}
}