中文

用于基于骨架动作识别的时空Inception图卷积网络

计算机视觉与模式识别 2021-08-23 v2 人工智能 机器学习 多媒体

摘要

随着易用深度传感器的普及,基于骨架的人体动作识别已引起广泛关注。近来,图卷积网络(GCNs)因建模图数据的强大能力而被广泛用于该任务。邻接图的拓扑结构是建模输入骨架相关性的关键因素。因此,以往方法主要关注图拓扑的设计/学习。但一旦拓扑被学习,网络各层仅存在单尺度特征与单一变换。诸多在卷积神经网络(CNNs)中已被证明十分有效的思路,如多尺度信息与多组变换,尚未在GCNs中得到探究。原因在于,由于图结构骨架数据与传统图像/视频数据间的鸿沟,将这些思路嵌入GCNs极具挑战。为克服此鸿沟,我们在GCNs中重新设计了用于骨架序列处理的split-transform-merge策略。具体而言,我们设计了一种简单且高度模块化的图卷积网络架构用于基于骨架的动作识别。我们的网络由重复构建块构成,该构建块从空间与时间路径聚合多粒度信息。大量实验表明,我们的网络以仅1/5的参数量和1/10的FLOPs显著优于当前最优方法。代码见https://github.com/yellowtownhz/STIGCN。

关键词

引用

@article{arxiv.2011.13322,
  title  = {Spatio-Temporal Inception Graph Convolutional Networks for Skeleton-Based Action Recognition},
  author = {Zhen Huang and Xu Shen and Xinmei Tian and Houqiang Li and Jianqiang Huang and Xian-Sheng Hua},
  journal= {arXiv preprint arXiv:2011.13322},
  year   = {2021}
}

备注

ACM MM 2020