中文

重新审视少样本动作识别中的空间与时间建模

计算机视觉与模式识别 2023-04-11 v2 人工智能

摘要

空间与时间建模是少样本动作识别最核心的方面之一。以往大多数工作主要基于高层空间表示关注长期时间关系建模,而未考虑关键的低层空间特征与短期时间关系。实际上,前者特征可带来丰富的局部语义信息,后者特征可分别表示相邻帧的运动特性。本文中,我们提出 SloshNet,一种以更精细方式重新审视少样本动作识别空间与时间建模的新框架。首先,为利用低层空间特征,我们设计了一个特征融合架构搜索模块,自动搜索低层与高层空间特征的最佳组合。接着,受近期 transformer 启发,我们引入一个长期时间建模模块,基于提取的空间外观特征建模全局时间关系。同时,我们设计另一个短期时间建模模块来编码相邻帧表示间的运动特性。之后,将嵌入的丰富时空特征输入常见的帧级类原型匹配器即可得到最终预测。我们在四个少样本动作识别数据集(包括 Something-Something V2、Kinetics、UCF101 和 HMDB51)上广泛验证了所提 SloshNet。它在所有数据集上均取得了优于最先进方法的结果。

关键词

引用

@article{arxiv.2301.07944,
  title  = {Revisiting the Spatial and Temporal Modeling for Few-shot Action Recognition},
  author = {Jiazheng Xing and Mengmeng Wang and Yong Liu and Boyu Mu},
  journal= {arXiv preprint arXiv:2301.07944},
  year   = {2023}
}