中文

面向基于骨架的动作识别的时空聚焦

计算机视觉与模式识别 2022-04-01 v1

摘要

图卷积网络(GCNs)因建模数据拓扑的强大能力而被广泛采用于基于骨架的动作识别。我们认为近期提出的基于骨架的动作识别方法的性能受以下因素限制。首先,预定义图结构在网络中共享,缺乏建模多粒度语义信息的灵活性与容量。其次,图局部卷积未充分挖掘全局关节间的关系,可能丢失隐式关节相关性。例如,跑和挥手等动作由身体部位与关节(如腿和臂)的协同运动完成,但其在物理连接上相距较远。受近期注意力机制启发,我们提出一个多粒度上下文聚焦模块,称为 MCF,以从身体关节与部位捕获动作关联的关系信息。由此,MCF 可为不同骨架动作序列获得更具可解释性的表示。本研究中,我们遵循常见做法采用输入骨架序列的密集采样策略,但因实例数量与动作无关,这带来了大量冗余。为降低冗余,我们开发了时间判别聚焦模块,称为 TDF,以捕获时间动态的局部敏感点。MCF 与 TDF 被集成至标准 GCN 网络形成统一架构,命名为 STF-Net。需注意,STF-Net 基于多粒度上下文聚合与时间依赖,提供了从这些骨架拓扑结构捕获鲁棒运动模式的能力。大量实验结果表明,我们的 STF-Net 在三个具挑战性基准 NTU RGB+D 60、NTU RGB+D 120 与 Kinetics-skeleton 上显著取得最先进结果。

关键词

引用

@article{arxiv.2203.16767,
  title  = {SpatioTemporal Focus for Skeleton-based Action Recognition},
  author = {Liyu Wu and Can Zhang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2203.16767},
  year   = {2022}
}

备注

Submitted to TCSVT