深度感知的动作识别:通过时序热图编码姿态与运动
计算机视觉与模式识别
2020-11-30 v1 机器学习
摘要
大多数最先进的动作识别方法仅依赖编码外观、运动或姿态的 2D 空间特征。然而,2D 数据缺乏对于识别细粒度动作至关重要的深度信息。在本文中,我们提出了一种深度感知的体积描述子,在统一表示中编码姿态与运动信息,用于真实场景下的动作分类。我们的框架对动作识别中固有的诸多挑战具有鲁棒性,例如视角、场景、衣着与体形的变化。我们方法的关键组件是深度感知姿态运动表示(DA-PoTion),一种编码人体语义关键点 3D 运动的新型视频描述子。给定一段视频,我们使用最先进的 3D 人体姿态回归器为每一帧生成人体关节热图,并根据其在片段中的相对时间为每个热图赋予唯一颜色编码。然后,我们聚合所有人体关节的此类 3D 时间编码热图,获得固定尺寸的描述子(DA-PoTion),其适用于使用浅层 3D 卷积神经网络(CNN)分类动作。DA-PoTion 单独即在 Penn Action Dataset 上定义了新的最先进水平。此外,我们通过将我们的姿态运动描述子与基于外观的方法(Inflated 3D ConvNet, I3D)结合,利用二者内在互补性,在 JHMDB Dataset 上定义了新的最先进水平。
引用
@article{arxiv.2011.13399,
title = {Depth-Aware Action Recognition: Pose-Motion Encoding through Temporal Heatmaps},
author = {Mattia Segu and Federico Pirovano and Gianmario Fumagalli and Amedeo Fabris},
journal= {arXiv preprint arXiv:2011.13399},
year = {2020}
}