中文

基于多尺度时空注意力的上下文感知网络用于视频动作识别

计算机视觉与模式识别 2025-12-23 v1

摘要

动作识别是视频理解中的关键任务,需要全面捕获各种尺度的时空线索。然而,现有方法常常忽视动作的多粒度特性。为解决这一局限性,我们引入了上下文感知网络(CAN)。CAN由两个核心模块组成: 多尺度时空线索模块(MTCM)和群组时空线索模块(GSCM)。MTCM有效地在多个尺度上提取时空线索,既捕获快速变化的运动细节,也捕获整体动作流。GSCM则通过对特征图进行分组并对每个分组应用专门的提取方法来提取不同尺度的时空线索。在五个基准数据集(Something-Something V1 和 V2、Diving48、Kinetics-400 和 UCF101)上的实验表明,CAN的有效性。我们的 approach 在 Something-Something V1 上达到 50.4% 的准确率,在 Something-Something V2 上达到 63.9% 的准确率,在 Diving48 上达到 88.4% 的准确率,在 Kinetics-400 上达到 74.9% 的准确率,在 UCF101 上达到 86.9% 的准确率。这些结果凸显了捕获多尺度时空线索对于稳健动作识别的重要性。

关键词

引用

@article{arxiv.2512.18750,
  title  = {Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos},
  author = {Xiaoyang Li and Wenzhu Yang and Kanglin Wang and Tiebiao Wang and Qingsong Fei},
  journal= {arXiv preprint arXiv:2512.18750},
  year   = {2025}
}

备注

21 pages, 4 figures. Preprint under review for journal submission