中文

用于基于骨架动作识别的位姿引导图卷积网络

计算机视觉与模式识别 2022-10-13 v1 图像与视频处理 信号处理

摘要

图卷积网络(GCNs)能将人体骨架建模为空间图和时间图,在基于骨架的动作识别中展现出显著潜力。然而,在现有基于 GCN 的方法中,人体骨架的图结构表示难以与其他模态融合,尤其在早期阶段。这可能限制其在动作识别任务中的可扩展性与性能。此外,位姿信息天然包含对动作识别具有信息性和判别性的线索,现有方法很少将其与骨架数据共同探索。本工作中,我们提出位姿引导 GCN(PG-GCN),一种用于高性能人体动作识别的多模态框架。具体而言,构建多流网络以同时从位姿和骨架数据中挖掘鲁棒特征,并设计动态注意力模块用于早期特征融合。该模块的核心思想是利用可训练图聚合来自骨架流与位姿流的特征,从而使网络具备更强的鲁棒特征表示能力。大量实验表明,所提 PG-GCN 在 NTU RGB+D 60 与 NTU RGB+D 120 数据集上可达到最先进(SOTA)性能。

关键词

引用

@article{arxiv.2210.06192,
  title  = {Pose-Guided Graph Convolutional Networks for Skeleton-Based Action Recognition},
  author = {Han Chen and Yifan Jiang and Hanseok Ko},
  journal= {arXiv preprint arXiv:2210.06192},
  year   = {2022}
}