中文

庞加莱几何中混合维度的基于 3D 骨架的动作识别

计算机视觉与模式识别 2020-08-04 v2

摘要

图卷积网络(GCNs)已经展示了其对不规则数据(如人体动作识别中的骨架数据)建模的强大能力,为融合图中不同节点丰富结构信息提供了令人振奋的新途径。在人体动作识别中,现有工作引入动态图生成机制以更好地捕捉潜在语义骨架连接,从而提升性能。本文中,我们提供了一种正交的方式来探索潜在连接。我们并未引入代价高昂的动态图生成范式,而是在黎曼流形上构建了更高效的 GCN,认为其是更适于建模图数据的空间,以使提取的表示契合嵌入矩阵。具体而言,我们提出了一种通过庞加莱几何定义的新颖时空 GCN(ST-GCN)架构,使其能更好地建模结构数据的潜在解剖特征。为进一步探索黎曼空间中的最优投影维度,我们在流形上混合不同维度,并提供了一种高效方法来探索各 ST-GCN 层的维度。利用最终所得架构,我们在两个当前最大规模的 3D 数据集(即 NTU RGB+D 和 NTU RGB+D 120)上评估了我们的方法。对比结果表明,与先前最佳 GCN 方法相比,该模型在任意给定评测指标下仅以 40% 的模型大小即可取得更优性能,证明了我们模型的有效性。

关键词

引用

@article{arxiv.2007.15678,
  title  = {Mix Dimension in Poincar\'{e} Geometry for 3D Skeleton-based Action Recognition},
  author = {Wei Peng and Jingang Shi and Zhaoqiang Xia and Guoying Zhao},
  journal= {arXiv preprint arXiv:2007.15678},
  year   = {2020}
}

备注

Accepted by ACM MM2020