基于计算机视觉的群体活动检测与动作定位
计算机视觉与模式识别
2025-11-18 v1 人工智能
摘要
多人场景中的群体活动检测因复杂的人类相互作用、遮挡以及随时间变化的外观差异而具有挑战性。本文提出了一种基于计算机视觉的框架,用于利用深度学习模型和图基关系推理进行群体活动识别与动作定位。系统首先应用 Mask R-CNN 通过边界框和实例掩码获取精确的演员局部分析。包括 Inception V3、MobileNet 和 VGG16 在内的多个主干网络用于提取特征图,并应用 RoIAlign 在生成演员特定特征时保持空间对齐。随后将掩码信息与特征图融合,以获得每个演员的细化掩码特征表示。为建模个体之间的相互作用,我们构建演员关系图(Actor Relation Graph),使用归一化交叉相关、绝对差之和和点积等方法编码外观相似性和位置关系。图卷积网络在这些图上进行操作,以推理关系并预测单个动作和群体层面的活动。在 Collective Activity 数据集上进行的实验表明,掩码特征细化、鲁棒相似性搜索和图神经网络推理的组合在密集和非密集场景中均实现了 improved recognition performance。这一方法凸显了将分割、特征提取和关系图推理集成用于复杂视频理解任务的潜力。
关键词
引用
@article{arxiv.2511.13315,
title = {Computer Vision based group activity detection and action spotting},
author = {Narthana Sivalingam and Santhirarajah Sivasthigan and Thamayanthi Mahendranathan and G. M. R. I. Godaliyadda and M. P. B. Ekanayake and H. M. V. R. Herath},
journal= {arXiv preprint arXiv:2511.13315},
year = {2025}
}