解耦与统一基于骨架动作识别的图卷积
计算机视觉与模式识别
2020-05-20 v2
摘要
基于骨架的动作识别算法已广泛使用时空图来建模人体动作动态。为了从这些图中捕获鲁棒的运动模式,长程和多尺度上下文聚合以及时空依赖建模是强大特征提取器的关键方面。然而,现有方法在实现(1)多尺度算子下的无偏长程关节关系建模和(2)用于捕获复杂时空依赖的无阻碍跨时空信息流方面存在局限性。在本工作中,我们提出了(1)一种解耦多尺度图卷积的简单方法和(2)一种名为 G3D 的统一时空图卷积算子。所提出的多尺度聚合方案解耦了不同邻域中节点的重要性,以实现有效的长程建模。所提出的 G3D 模块利用密集的跨时空边作为跳跃连接,以实现跨时空图的直接信息传播。通过结合这些提议,我们开发了一个名为 MS-G3D 的强大特征提取器,基于此我们的模型在三个大规模数据集上超越了先前的 SOTA 方法:NTU RGB+D 60、NTU RGB+D 120 和 Kinetics Skeleton 400。
引用
@article{arxiv.2003.14111,
title = {Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition},
author = {Ziyu Liu and Hongwen Zhang and Zhenghao Chen and Zhiyong Wang and Wanli Ouyang},
journal= {arXiv preprint arXiv:2003.14111},
year = {2020}
}
备注
CVPR 2020