构建更强更快的基于骨架的动作识别基线
计算机视觉与模式识别
2022-03-04 v2
摘要
基于骨架的动作识别中的一个本质问题是如何在所有骨架关节上提取判别性特征。然而,近期该任务的最先进(SOTA)模型的复杂度趋向于过度复杂和过参数化。模型训练与推理的低效率增加了在大规模数据集中验证模型架构的成本。为解决上述问题,我们将近期先进的可分离卷积层嵌入到早期融合的多输入分支(MIB)网络中,构建了用于基于骨架的动作识别的高效图卷积网络(GCN)基线。此外,基于此基线,我们设计了一种复合缩放策略以同步扩展模型的宽度和深度,最终获得一系列具有高准确率且可训练参数量少的高效 GCN 基线,称为 EfficientGCN-Bx,其中“x”表示缩放系数。在两个大规模数据集即 NTU RGB+D 60 和 120 上,所提出的 EfficientGCN-B4 基线优于其他 SOTA 方法,例如在 NTU 60 数据集的跨主体基准上达到 91.7% 准确率,同时比最佳 SOTA 方法之一的 MS-G3D 小 3.15 倍且快 3.21 倍。PyTorch 版本的源代码和预训练模型可在 https://github.com/yfsong0709/EfficientGCNv1 获取。
引用
@article{arxiv.2106.15125,
title = {Constructing Stronger and Faster Baselines for Skeleton-based Action Recognition},
author = {Yi-Fan Song and Zhang Zhang and Caifeng Shan and Liang Wang},
journal= {arXiv preprint arXiv:2106.15125},
year = {2022}
}
备注
15 pages, 12 tables, 10 figures, Accepted by IEEE T-PAMI. arXiv admin note: text overlap with arXiv:2010.09978