中文

用于基于骨架的动作识别的超图Transformer

计算机视觉与模式识别 2023-03-23 v5

摘要

基于骨架的动作识别旨在给定人体关节坐标及骨骼互连的情况下识别人类动作。通过将关节定义为顶点、其自然连接定义为边来构图,已有工作成功采用图卷积网络(GCNs)建模关节共现并取得了优越性能。最近,GCNs的一个局限被指出,即拓扑在训练后固定。为放宽此限制,自注意力(SA)机制被采用以使GCNs的拓扑自适应于输入,从而产生了最先进的混合模型。同时,也有使用普通Transformer的尝试,但因缺乏结构先验仍落后于最先进的基于GCN的方法。与混合模型不同,我们提出了一种更优雅的方案,通过图距离嵌入将骨骼连通性融入Transformer。我们的嵌入在训练期间保留了骨骼结构信息,而GCNs仅将其用于初始化。更重要的是,我们揭示了图模型普遍存在的潜在问题,即逐对聚合本质上忽略了身体关节间的高阶运动学依赖。为填补此空白,我们提出了一种基于超图的新型自注意力(SA)机制,称为超图自注意力(HyperSA),以将内在的高阶关系纳入模型。我们将所得模型命名为Hyperformer,其在NTU RGB+D、NTU RGB+D 120及Northwestern-UCLA数据集上于精度与效率方面均击败了最先进的图模型。

关键词

引用

@article{arxiv.2211.09590,
  title  = {Hypergraph Transformer for Skeleton-based Action Recognition},
  author = {Yuxuan Zhou and Zhi-Qi Cheng and Chao Li and Yanwen Fang and Yifeng Geng and Xuansong Xie and Margret Keuper},
  journal= {arXiv preprint arXiv:2211.09590},
  year   = {2023}
}