面向基于骨骼动作识别的 To-a-T 时空聚焦
计算机视觉与模式识别
2022-02-07 v1
摘要
图卷积网络(GCNs)已被广泛用于建模基于骨骼的动作识别中的高阶动态依赖关系。大多数现有方法未将高阶时空重要性显式嵌入到关节的空间连接拓扑与强度中,且其注意力模块缺乏直接目标来联合学习在动作序列中何时与何处的聚焦。为解决这些问题,我们提出了 To-a-T 时空聚焦(STF),一种利用时空梯度聚焦于相关时空特征的基于骨骼的动作识别框架。我们首先提出具有可学习梯度增强和实例依赖邻接矩阵的 STF 模块,以建模高阶时空动态。其次,我们提出三个定义在基于梯度的时空聚焦上的损失项,以显式引导分类器何时与何处观察、区分易混淆类别并优化堆叠的 STF 模块。STF 在 NTU RGB+D 60、NTU RGB+D 120 和 Kinetics Skeleton 400 数据集上,针对不同视角、对象、设置和输入模态的所有 15 种设定均优于最先进方法,且 STF 在稀缺数据和数据集偏移设定下也展现出更好的精度。
引用
@article{arxiv.2202.02314,
title = {Towards To-a-T Spatio-Temporal Focus for Skeleton-Based Action Recognition},
author = {Lipeng Ke and Kuan-Chuan Peng and Siwei Lyu},
journal= {arXiv preprint arXiv:2202.02314},
year = {2022}
}
备注
AAAI 2022