基于空间时间全景图的骨架群体活动识别
计算机视觉与模式识别
2024-12-02 v2
摘要
群体活动识别旨在从视频中理解集体活动。现有方法主要依赖RGB模态,面临背景变化、遮挡、运动模糊和显著计算开销等挑战。而当前基于关键点的骨架方法提供了轻量且信息丰富的人类运动表示,但需要准确的单个注释和专门的交互推理模块。为解决这些限制,我们设计了一种全景图,将多人骨架和物体纳入其中,以封装群体活动,为RGB视频提供了有效的替代方案。该全景图使Graph卷积网络(GCN)能够通过空间时间图卷积统一处理人内部分、人与人之间的以及人与物体之间的交互建模。实际中,我们开发了一个新型管道,使用姿态估计算法和跟踪算法提取骨架坐标,并采用Multi-person Panoramic GCN(MP-GCN)预测群体活动。在Volleyball和NBA数据集上进行的大量实验表明,MP-GCN在准确率和效率方面均实现了最先进的性能。值得注意的是,我们的方法仅使用估计的2D关键点作为输入,就超过了基于RGB的方法。代码已公开:https://github.com/mgiant/MP-GCN。
引用
@article{arxiv.2407.19497,
title = {Skeleton-based Group Activity Recognition via Spatial-Temporal Panoramic Graph},
author = {Zhengcen Li and Xinle Chang and Yueran Li and Jingyong Su},
journal= {arXiv preprint arXiv:2407.19497},
year = {2024}
}
备注
Accepted to ECCV 2024