中文

统一全局与局部场景实体建模以实现精确动作定位

计算机视觉与模式识别 2024-04-16 v1

摘要

体育视频带来了复杂的挑战,包括杂乱的背景、摄像机角度变化、代表动作的小物体以及不平衡的动作类别分布。现有的体育视频中动作检测方法严重依赖全局特征,利用骨干网络作为一个涵盖整个空间帧的黑盒。然而,这些方法往往忽略了场景的细微差别,并且在检测仅占据帧中一小部分的动作时存在困难。特别是,在处理涉及小物体的动作类别(例如足球中的球或黄/红牌,它们仅占据屏幕空间的一小部分)时,它们面临困难。为了应对这些挑战,我们引入了一种新颖的方法,该方法使用自适应注意力机制来分析和建模场景实体。具体而言,我们的模型将场景内容解耦为全局环境特征和局部相关场景实体特征。为了以较少的计算成本高效提取环境特征并同时考虑时间信息,我们提出使用带有时间移位机制的 2D 骨干网络。为了准确捕获相关场景实体,我们采用视觉-语言模型并结合自适应注意力机制。我们的模型展示了出色的性能,在 SoccerNet-v2 Action Spotting、FineDiving 和 FineGym 挑战赛中均获得第一名,与第二名方法相比,avg-mAP 分别实现了 1.6、2.0 和 1.3 分的显著性能提升。此外,与其他通常被设计为黑盒的深度学习模型相比,我们的方法提供了可解释性能力。我们的代码和模型已发布于:https://github.com/Fsoft-AIC/unifying-global-local-feature。

关键词

引用

@article{arxiv.2404.09951,
  title  = {Unifying Global and Local Scene Entities Modelling for Precise Action Spotting},
  author = {Kim Hoang Tran and Phuc Vuong Do and Ngoc Quoc Ly and Ngan Le},
  journal= {arXiv preprint arXiv:2404.09951},
  year   = {2024}
}

备注

Accepted to IJCNN 2024