基于骨架的动作识别:多流自适应图卷积网络
计算机视觉与模式识别
2020-12-02 v1
摘要
图卷积网络(GCNs)将 CNN 推广到更一般的非欧几里得结构,在基于骨架的动作识别中取得了卓越性能。然而,先前基于 GCN 的模型仍存在若干问题。首先,图的拓扑是启发式设定并在所有模型层与输入数据上固定不变。这可能不适合 GCN 模型的层次结构以及动作识别任务中数据的多样性。其次,骨架数据的二阶信息,即骨骼的长度与方向,很少被研究,而这在人体动作识别中天然更具信息量与判别力。在本工作中,我们提出一种新颖的用于基于骨架动作识别的多流注意力增强自适应图卷积神经网络(MS-AAGCN)。我们模型中的图拓扑可基于输入数据以端到端方式被统一或分别学习。这种数据驱动的方法增加了模型在图构建上的灵活性,并带来更强的通用性以适应各类数据样本。此外,所提出的自适应图卷积层进一步由空-时-通道注意力模块增强,帮助模型更关注重要的关节、帧与特征。而且,关节与骨骼的信息及其运动信息在一个多流框架中同时被建模,显示出识别准确率的显著提升。在两个大规模数据集 NTU-RGBD 与 Kinetics-Skeleton 上的大量实验表明,我们的模型性能以显著优势超越当前最优(SOTA)。
引用
@article{arxiv.1912.06971,
title = {Skeleton-Based Action Recognition with Multi-Stream Adaptive Graph Convolutional Networks},
author = {Lei Shi and Yifan Zhang and Jian Cheng and Hanqing Lu},
journal= {arXiv preprint arXiv:1912.06971},
year = {2020}
}