中文

SOAP: 提升少样本动作识别中时空关系与运动信息捕获的框架

计算机视觉与模式识别 2026-03-25 v7 人工智能

摘要

高帧率( HFR )视频在动作识别中改善细粒度表达的同时,会降低时空关系和运动信息的密度。因此,传统数据驱动训练方法需要大量视频样本。然而在实际场景中样本数常常不足,这促使了少样本动作识别( FSAR )的研究。我们注意到,近期的大多数 FSAR 工作在空间特征提取后通过时序对齐来构建时空关系,将空间和时间特征在样本内割裂。此外,这些方法通过窄化相邻帧之间的视角来捕获运动信息,未考虑密度因素,导致运动信息捕获不足。因此,本文提出了一种名为 Spatio-tempOral frAme tuPle enhancer( SOAP )的新型可插拔式框架,用于 FSAR。我们设计的模型即 SOAP-Net 考虑了不同特征通道之间的时序连接以及特征的时空关系,而非简单地进行特征提取。同时,通过包含多个帧的帧组捕获更全面的运动信息,进一步利用帧组中不同帧数的组合提供更广阔的视角。SOAP-Net 在 SthSthV2、Kinetics、UCF101 和 HMDB51 等知名基准数据集上实现了新的最佳性能。大量经验评估凸显了 SOAP 的竞争性、可插拔性、泛化性和鲁棒性。代码已发布于 https://github.com/wenbohuang1002/SOAP。

关键词

引用

@article{arxiv.2407.16344,
  title  = {SOAP: Enhancing Spatio-Temporal Relation and Motion Information Capturing for Few-Shot Action Recognition},
  author = {Wenbo Huang and Jinghui Zhang and Xuwei Qian and Zhen Wu and Meng Wang and Lei Zhang},
  journal= {arXiv preprint arXiv:2407.16344},
  year   = {2026}
}

备注

Accepted by ACM MM 2024