更强、更快且更具可解释性:基于骨架动作识别的图卷积基线模型
计算机视觉与模式识别
2020-10-21 v1
摘要
基于骨架的动作识别中的一个基本问题是如何在所有骨架关节上提取判别性特征。然而,该任务的最先进(SOTA)模型的复杂度往往过于复杂且过度参数化,模型训练和推理的低效率阻碍了该领域的发展,尤其是对于大规模动作数据集。在这项工作中,我们提出了一种基于图卷积网络(GCN)的高效但强劲的基线,其中聚合了三项主要改进,即早期融合的多输入分支(MIB)、具有瓶颈结构的残差 GCN(ResGCN)和部件注意力(PartAtt)块。首先,设计 MIB 以在早期融合阶段丰富信息性骨架特征并保持紧凑表示。然后,受 ResNet 架构在卷积神经网络(CNN)中成功的启发,在 GCN 中引入 ResGCN 模块,以缓解计算成本并降低模型训练中的学习难度,同时保持模型精度。最后,提出 PartAtt 块以在整个动作序列中发现最关键的身体部件,并为不同的骨架动作序列获得更具可解释性的表示。在两个大规模数据集 NTU RGB+D 60 和 120 上的大量实验验证,所提基线略优于其他 SOTA 模型,同时在训练和推理过程中所需参数少得多,例如至多比最佳 SOTA 方法之一的 DGNN 少 34 倍。
引用
@article{arxiv.2010.09978,
title = {Stronger, Faster and More Explainable: A Graph Convolutional Baseline for Skeleton-based Action Recognition},
author = {Yi-Fan Song and Zhang Zhang and Caifeng Shan and Liang Wang},
journal= {arXiv preprint arXiv:2010.09978},
year = {2020}
}
备注
Accepted by ACM MultiMedia 2020, 9 pages, 4 figures, 5 tables