中文

面向基于骨架动作识别的聚焦与全局时空Transformer

计算机视觉与模式识别 2022-10-07 v1

摘要

尽管Transformer在各种视觉任务中取得了巨大进展,但其在基于骨架的动作识别中仍鲜有探索,仅有少数尝试。此外,这些方法在空间和时间维度上对所有关节同等计算成对全局自注意力,低估了判别性局部关节与短程时间动态的作用。本文提出一种新颖的聚焦与全局时空Transformer网络(FG-STFormer),其包含两个关键组件:(1) FG-SFormer:聚焦关节与全局部件耦合的空间Transformer。它迫使网络分别聚焦于对所学判别性空间关节与人体部件建模相关性。选择性聚焦关节在累积相关性时消除了非信息性关节的负面影响。同时,通过互交叉注意力融入聚焦关节与身体部件间的交互,以增强空间依赖。(2) FG-TFormer:聚焦与全局时间Transformer。将膨胀时间卷积整合进全局自注意力机制,以显式捕获关节或身体部件的局部时间运动模式,这被证明对时间Transformer发挥作用至关重要。在NTU-60、NTU-120与NW-UCLA三个基准上的大量实验结果表明,我们的FG-STFormer超越了所有现有的基于Transformer的方法,并与最先进的基于GCN的方法相当。

关键词

引用

@article{arxiv.2210.02693,
  title  = {Focal and Global Spatial-Temporal Transformer for Skeleton-based Action Recognition},
  author = {Zhimin Gao and Peitao Wang and Pei Lv and Xiaoheng Jiang and Qidong Liu and Pichao Wang and Mingliang Xu and Wanqing Li},
  journal= {arXiv preprint arXiv:2210.02693},
  year   = {2022}
}

备注

Accepted by ACCV2022