基于骨骼的动作识别:通过对比双流时空网络
计算机视觉与模式识别
2023-01-30 v1
摘要
为追求准确的基于骨骼的动作识别,大多数先前方法采用以串行方式将图卷积网络(GCNs)与基于注意力的方法相结合的策略。然而,它们将人体骨骼视为完全图,导致不同动作之间的区分度较低(例如,在“拍手”动作中肘部与头部之间的连接)。为此,我们提出了一种新颖的对比GCN-Transformer网络(ConGT),以并行方式融合空间和时间模块。ConGT包含两条并行流:时空图卷积流(STG)和时空Transformer流(STT)。STG旨在获取保持人体骨骼自然拓扑结构的动作表示。STT用于获取包含关节间全局关系的动作表示。由于这两条流产生的动作表示包含不同特征,且彼此对对方信息知之甚少,我们引入对比学习范式,以自监督方式引导同一样本的输出表示尽可能接近。通过对比学习,它们可以相互学习信息,通过最大化两类动作表示之间的互信息来丰富动作特征。为进一步提高动作识别准确率,我们引入循环焦点损失(CFL),其能在训练早期聚焦于置信样本,并在中期逐渐增加对困难样本的聚焦。我们在三个基准数据集上进行了实验,表明我们的模型在动作识别中达到了最先进的性能。
引用
@article{arxiv.2301.11495,
title = {Skeleton-based Action Recognition through Contrasting Two-Stream Spatial-Temporal Networks},
author = {Chen Pang and Xuequan Lu and Lei Lyu},
journal= {arXiv preprint arXiv:2301.11495},
year = {2023}
}
备注
14 pages, 9 figures