面向人类动作识别的时空图卷积网络是否存在过参数化问题?
计算机视觉与模式识别
2025-05-19 v1
摘要
时空图卷积网络(ST-GCNs)在骨架基准的人类动作识别(HAR)中显示出惊人的性能。然而,尽管发展了众多模型,但在对齐输入设置后,其识别性能并不显著 differ。基于此观察,我们假设ST-GCNs对于HAR存在过参数化问题,该假设经实验验证确认,采用 lottery ticket hypothesis 方法。此外,提出一种新型稀疏ST-GCNs生成器,该生成器在保持与稠密组件相当性能的同时,从随机初始化的稠密网络上训练稀疏结构。此外,我们通过在各种稀疏水平上整合稀疏结构来生成多级稀疏ST-GCNs,并证明装配的模型在HAR性能上显著提升。针对四个数据集(包括 NTU-RGB+D 60(120)、Kinetics-400 和 FineGYM)进行彻底实验,表明所提出的稀疏ST-GCNs可以实现与其稠密组件相当的性能。即使参数数量减少95%,稀疏ST-GCNs也仅在top-1准确率上降低<1%。与此同时,仅需稠密ST-GCNs参数量66%的多级稀疏ST-GCNs,在top-1准确率上提升>1%。代码可在 https://github.com/davelailai/Sparse-ST-GCN 提供。
引用
@article{arxiv.2505.10679,
title = {Are Spatial-Temporal Graph Convolution Networks for Human Action Recognition Over-Parameterized?},
author = {Jianyang Xie and Yitian Zhao and Yanda Meng and He Zhao and Anh Nguyen and Yalin Zheng},
journal= {arXiv preprint arXiv:2505.10679},
year = {2025}
}