中文

用于少样本动作识别的时空关系建模

计算机视觉与模式识别 2022-04-06 v2

摘要

我们提出一种新颖的少样本动作识别框架 STRM,其在增强类特定特征判别力的同时学习高阶时间表示。我们方法的核心是一个新颖的时空增强模块,该模块通过专用的局部块级和全局帧级特征增强子模块聚合空间与时间上下文。局部块级增强捕捉基于外观的动作特征。另一方面,全局帧级增强显式编码广泛的时序上下文,从而随时间捕捉相关对象特征。由此得到的时空增强表示随后被用于学习查询与支持动作子序列之间的关系匹配。我们进一步在块级增强特征上引入查询-类别相似度分类器,通过强化所提框架中不同阶段的特特征学习来增强类特定特征判别力。实验在四个少样本动作识别基准上进行:Kinetics、SSv2、HMDB51 和 UCF101。我们广泛的消融研究揭示了所提贡献的优势。此外,我们的方法在所有四个基准上均确立了新的最先进水平。在具挑战性的 SSv2 基准上,与文献中最佳现有方法相比,我们的方法在分类准确率上实现了 3.5%3.5\% 的绝对提升。我们的代码与模型见 https://github.com/Anirudh257/strm。

关键词

引用

@article{arxiv.2112.05132,
  title  = {Spatio-temporal Relation Modeling for Few-shot Action Recognition},
  author = {Anirudh Thatipelli and Sanath Narayan and Salman Khan and Rao Muhammad Anwer and Fahad Shahbaz Khan and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2112.05132},
  year   = {2022}
}

备注

CVPR 2022