中文

聚焦与扩散:用于基于骨架的动作识别的双向注意力图卷积网络

计算机视觉与模式识别 2019-12-30 v1 机器学习 机器人学

摘要

一系列基于图卷积网络的方法通过探索帧内关节的邻域信息和稠密依赖关系,在基于骨架的动作识别中已被证明成功。然而,这些方法通常忽略空间-时间全局上下文以及帧间与帧内之间的局部关系。在本文中,我们提出一种聚焦与扩散机制,通过关注 articulated 人体姿态在一帧中的运动学依赖及其跨帧的隐式依赖来增强图卷积网络。在聚焦过程中,我们引入一个注意力模块,在帧内关节上学习一个潜在节点以传递空间上下文信息。以此方式,一帧中关节间的稀疏连接可被很好地捕获,而整个序列上的全局上下文进一步由这些隐藏节点通过双向 LSTM 捕获。在扩散过程中,学到的空间-时间上下文信息被传回空间关节,从而产生一种可促进基于骨架的动作识别的双向注意力图卷积网络(BAGCN)。在具有挑战性的 NTU RGB+D 和 Skeleton-Kinetics 基准上的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.1912.11521,
  title  = {Focusing and Diffusion: Bidirectional Attentive Graph Convolutional Networks for Skeleton-based Action Recognition},
  author = {Jialin Gao and Tong He and Xi Zhou and Shiming Ge},
  journal= {arXiv preprint arXiv:1912.11521},
  year   = {2019}
}