一种基于骨架数据的端到端时空注意力人体动作识别模型
计算机视觉与模式识别
2016-11-21 v1
摘要
人体动作识别是计算机视觉中的一项重要任务。提取具有判别性的空间和时间特征以建模不同动作的时空演化,是完成该任务的关键。在本研究中,我们提出了一种基于骨架数据进行人体动作识别的端到端时空注意力模型。我们的模型建立在带有长短期记忆的循环神经网络之上,该网络学习选择性地聚焦于输入每帧内骨架的判别性关节,并对不同帧的输出给予不同程度的关注。此外,为了确保网络的有效训练,我们提出了一种正则化交叉熵损失来驱动模型学习过程,并相应地开发了联合训练策略。实验结果证明了所提出模型的有效性,无论是在小规模人体动作识别数据集 SBU 还是目前最大规模的数据集 NTU 上均表现良好。
引用
@article{arxiv.1611.06067,
title = {An End-to-End Spatio-Temporal Attention Model for Human Action Recognition from Skeleton Data},
author = {Sijie Song and Cuiling Lan and Junliang Xing and Wenjun Zeng and Jiaying Liu},
journal= {arXiv preprint arXiv:1611.06067},
year = {2016}
}