中文

基于关键点的统一动作识别框架:结构化关键点池化

计算机视觉与模式识别 2023-03-28 v1 人工智能 机器学习

摘要

本文同时针对传统基于骨架的动作识别存在的三个局限:骨架检测与跟踪误差、目标动作种类匮乏,以及逐人与逐帧动作识别。我们将点云深度学习范式引入动作识别,并提出了一个统一框架以及一种称为结构化关键点池化(Structured Keypoint Pooling)的新型深度神经网络架构。所提方法基于数据结构(骨架中固有的)的先验知识(如每个关键点所属的实例与帧),以级联方式稀疏聚合关键点特征,从而实现对输入误差的鲁棒性。其约束较少且无需跟踪的架构使得由人体骨架与非人体对象轮廓组成的时间序列关键点能够作为输入的3D点云被高效处理,并扩展了目标动作的种类。此外,受结构化关键点池化启发,我们提出了池化切换技巧(Pooling-Switching Trick)。该技巧在训练与推理阶段切换池化核,以仅使用视频级动作标签的弱监督方式检测逐人与逐帧动作。此技巧使我们的训练方案自然引入了一种新的数据增强,即混合从不同的视频中提取的多个点云。在实验中,我们全面验证了所提方法针对上述局限的有效性,且该方法优于最先进的基于骨架的动作识别与时空动作定位方法。

关键词

引用

@article{arxiv.2303.15270,
  title  = {Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling},
  author = {Ryo Hachiuma and Fumiaki Sato and Taiki Sekii},
  journal= {arXiv preprint arXiv:2303.15270},
  year   = {2023}
}

备注

CVPR 2023