基于骨架的体育动作识别中的跨块细粒度语义级联
计算机视觉与模式识别
2024-05-01 v1
摘要
人体动作视频识别最近在视频安全和体育姿态纠正等应用中受到更多关注。包括将人体骨架建模为时空图的图卷积网络 (GCN) 等流行方案已被证明非常有效。基于堆叠模块的 GCN 方法通常利用顶层语义进行分类/标注。虽然通过该过程学习的全局特征适用于通用分类,但难以捕获相邻帧之间细粒度的动作变化——这往往是体育动作的决定性因素。本文提出一种名为 Cross-block Fine-grained Semantic Cascade (CFSC) 的新型模块,以克服这一挑战。总体而言,所提出的 CFSC 模块逐步将浅层视觉知识整合到高层模块中,以便网络聚焦于动作细节。具体而言,CFSC 模块利用来自不同层级的 GCN 特征图,以及来自前序层级的聚合特征,以整合细粒度特征。此外,在每个层级应用专门的时域卷积,以学习短期时域特征,这些特征将从浅层传递到深层,以最大化低级细节的利用。这种跨模块特征聚合方法能够减轻细粒度信息的丢失,从而提升性能。最后, 我们收集了一个用于 fencing 体育动作识别的新数据集 FD-7,并将公开提供。在公开基准数据集 (FSD-10) 和自采数据集 (FD-7) 上的实验结果和经验分析表明,CFSC 模块在学习动作分类的判别性模式方面优于其他方法。
引用
@article{arxiv.2404.19383,
title = {Cross-Block Fine-Grained Semantic Cascade for Skeleton-Based Sports Action Recognition},
author = {Zhendong Liu and Haifeng Xia and Tong Guo and Libo Sun and Ming Shao and Siyu Xia},
journal= {arXiv preprint arXiv:2404.19383},
year = {2024}
}