中文

用于动作识别的时空对齐网络

计算机视觉与模式识别 2023-08-22 v1

摘要

本文研究在现有动作识别架构中引入视角不变特征表示。尽管动作识别已取得显著进展,但在大规模数据集中高效处理几何变化仍具挑战。为应对该问题,我们提出一种新颖的时空对齐网络(STAN),其显式学习用于动作识别的几何不变表示。值得注意的是,STAN 模型轻量且通用,能以较低的额外计算成本插入现有动作识别模型(如 MViTv2)。我们在 UCF101 与 HMDB51 等广泛使用的数据集上测试了 STAN 模型。实验结果表明,在从头训练的设置下,STAN 模型能持续提升动作识别任务中的最先进模型。

关键词

引用

@article{arxiv.2308.09897,
  title  = {Spatial-Temporal Alignment Network for Action Recognition},
  author = {Jinhui Ye and Junwei Liang},
  journal= {arXiv preprint arXiv:2308.09897},
  year   = {2023}
}

备注

Introducing viewpoint invariant feature representations in Action Recognition. arXiv admin note: text overlap with arXiv:2012.02426